Files
DevFlow/docs/02-架构设计/构想审查/多主题并存补充论证-多轮模式-2026-06-19.md
绝尘 998a2f243d 文档: 架构方案文档(意图识别论证+多主题愿景/论证+文档物理分类+边界清晰化)
squash合并:
- 意图识别层论证(8维度+10业界佐证)
- 多主题上下文管理愿景+并存论证+补充论证(多轮agentic)
- 架构设计文档物理分类(四子目录+INDEX+命名规范+引用同步+边界清晰化)
- 前端架构技术债清单归档
2026-06-19 15:04:04 +08:00

3.4 KiB

多主题并存补充论证:多轮模式(agentic 意图识别)

来源:multitopic-analysis 子代理补充(IRCoT/ReAct/Reflexion/FLARE/AwN/ECLAIR/Copilot/Cursor 硬数据)+ 用户深化(多轮请求上下文 + 实体 NER + 异步预热 + 边界场景)。 对原报告(多主题并存论证-2026-06-19.md)维度 2/3/4/6/8 的修正。纯论证,不改代码。

核心修正

原报告:准确率天花板是硬约束(SOTA 55.8/73%,不可绕过)。 修正:agentic 多轮模式确实能突破天花板(硬数据支撑),准确率从被动分类 55.8/73% → 可能 85%+。

突破证据(SOTA 硬数据)

模式 增益 来源
IRCoT(检索+CoT 交替) QA F1 +7~15 ACL 2023
ReAct(推理+行动) 准确率 +30% NeurIPS 2022
Reflexion(反思修正) pass@1 91% vs 80%(+11%) NeurIPS 2023
Agentic RAG(多跳) 34% → 89%(+55pp) Medium

但仍有约束(修正不改变近期结论)

  1. >90% 仍是硬线:devflow 有副作用工具(销账/状态机/文件写),Reflexion 91% 是上限非保证,须沙箱实测(不能假设 devflow 场景达标)
  2. 增益对场景敏感:FLARE 大场景仅 56.5%;简单请求多轮无收益反增延迟
  3. 边界场景 30-50% fallback 不变:多轮不消除边界(模糊/跨主题/新主题),ROI 仍稀释
  4. 三重栈复杂度:多轮编排 + 实体 NER + 异步预热 ~1300-1700 行 + 意图层先决(远期重投入)
  5. 异步预热解"慢"(关键技术):Copilot(sub-200ms 日 4 亿次)/ Cursor(生产落地)证明可行,但实现复杂度最高(草稿预分析 + 就绪判断 + 取消/重试 + 状态隔离)
  6. 主动澄清 vs 无感张力:业界范式(AwN/ECLAIR)倾向"低置信→主动问用户",违反"无感"愿景

修正后分阶段路径

近期(0-3月):不做(原结论不变)
  - 多轮是有前景的远期方向,但当前技术栈不具备(意图层未落/异步预热未建/多轮未验证)

中期(3-12月,低风险试点,按 ROI 排序):
  1. 用户显式标主题(零误判)
  2. 意图识别层 intent.rs 工具级落地(独立ROI + 多主题先决)
  3. 半自动高门槛(embedding>95%才隔离,多轮暂不上)

远期(12+月,完整 agentic 多主题):
  技术栈:意图层(稳定) + 异步预热(解延迟) + 多轮编排(IRCoT/Reflexion) + 实体NER
  触发(全部满足):准确率实测>90% + 异步预热就绪 + 意图层稳定 + 真实痛点
  顺序锁定:意图层 → 异步预热 → 多轮+NER(不可颠倒)

关键风险

  • 不能假设 devflow 场景多轮一定达>90%:Reflexion 91% 是受控 benchmark,devflow 交织主题 + 副作用工具更难,必须沙箱实测
  • "继续"/"1"短指代消息:全历史 LLM 天然消解(零逻辑,可靠);多主题下需路由(继承上一条主题),若上一条误判则错误传播

Sources