squash合并: - 意图识别层论证(8维度+10业界佐证) - 多主题上下文管理愿景+并存论证+补充论证(多轮agentic) - 架构设计文档物理分类(四子目录+INDEX+命名规范+引用同步+边界清晰化) - 前端架构技术债清单归档
3.4 KiB
3.4 KiB
多主题并存补充论证:多轮模式(agentic 意图识别)
来源:multitopic-analysis 子代理补充(IRCoT/ReAct/Reflexion/FLARE/AwN/ECLAIR/Copilot/Cursor 硬数据)+ 用户深化(多轮请求上下文 + 实体 NER + 异步预热 + 边界场景)。 对原报告(多主题并存论证-2026-06-19.md)维度 2/3/4/6/8 的修正。纯论证,不改代码。
核心修正
原报告:准确率天花板是硬约束(SOTA 55.8/73%,不可绕过)。 修正:agentic 多轮模式确实能突破天花板(硬数据支撑),准确率从被动分类 55.8/73% → 可能 85%+。
突破证据(SOTA 硬数据)
| 模式 | 增益 | 来源 |
|---|---|---|
| IRCoT(检索+CoT 交替) | QA F1 +7~15 | ACL 2023 |
| ReAct(推理+行动) | 准确率 +30% | NeurIPS 2022 |
| Reflexion(反思修正) | pass@1 91% vs 80%(+11%) | NeurIPS 2023 |
| Agentic RAG(多跳) | 34% → 89%(+55pp) | Medium |
但仍有约束(修正不改变近期结论)
- >90% 仍是硬线:devflow 有副作用工具(销账/状态机/文件写),Reflexion 91% 是上限非保证,须沙箱实测(不能假设 devflow 场景达标)
- 增益对场景敏感:FLARE 大场景仅 56.5%;简单请求多轮无收益反增延迟
- 边界场景 30-50% fallback 不变:多轮不消除边界(模糊/跨主题/新主题),ROI 仍稀释
- 三重栈复杂度:多轮编排 + 实体 NER + 异步预热 ~1300-1700 行 + 意图层先决(远期重投入)
- 异步预热解"慢"(关键技术):Copilot(sub-200ms 日 4 亿次)/ Cursor(生产落地)证明可行,但实现复杂度最高(草稿预分析 + 就绪判断 + 取消/重试 + 状态隔离)
- 主动澄清 vs 无感张力:业界范式(AwN/ECLAIR)倾向"低置信→主动问用户",违反"无感"愿景
修正后分阶段路径
近期(0-3月):不做(原结论不变)
- 多轮是有前景的远期方向,但当前技术栈不具备(意图层未落/异步预热未建/多轮未验证)
中期(3-12月,低风险试点,按 ROI 排序):
1. 用户显式标主题(零误判)
2. 意图识别层 intent.rs 工具级落地(独立ROI + 多主题先决)
3. 半自动高门槛(embedding>95%才隔离,多轮暂不上)
远期(12+月,完整 agentic 多主题):
技术栈:意图层(稳定) + 异步预热(解延迟) + 多轮编排(IRCoT/Reflexion) + 实体NER
触发(全部满足):准确率实测>90% + 异步预热就绪 + 意图层稳定 + 真实痛点
顺序锁定:意图层 → 异步预热 → 多轮+NER(不可颠倒)
关键风险
- 不能假设 devflow 场景多轮一定达>90%:Reflexion 91% 是受控 benchmark,devflow 交织主题 + 副作用工具更难,必须沙箱实测
- "继续"/"1"短指代消息:全历史 LLM 天然消解(零逻辑,可靠);多主题下需路由(继承上一条主题),若上一条误判则错误传播