论文综合 2023-2026 年的 benchmark 论文、分类法论文和审计论文,覆盖领域:
方法论:迭代归纳——将各论文独立报告的错误类别,分组到 agent 推理-执行流水线各阶段对应的主题下,形成统一分类法。作者声称这是首个跨上述六个维度统一整合的综合研究。
"Reported benchmark gains often obscure recurring failure modes documented across otherwise unrelated evaluation efforts."
Agent 在选择工具、构造参数、解析返回结果时的失败。这是 pipeline 最上游的失败,一旦发生会向下游放大。
典型子模式:
有实质进展:单轮工具使用准确率已明显提升(多数 benchmark 上 >70%),但多轮链式工具使用仍不稳定。
Agent 无法在多步规划中维持约束条件,或产生逻辑上不连贯的执行序列。
典型子模式:
随着任务步数增加,上下文窗口中积累的历史信息导致性能下降。这是当前 agent 能力的最硬限制之一。
典型子模式:
当多个 agent 需要协同完成任务时出现的特有失败模式。
典型子模式:
参见今日 StateFuse(2607.05844):用 CRDT 冲突保留内存直接解决"竞争冲突"子模式。
在对抗性输入或规范不足的条件下的失败,包括主动攻击和被动规范漏洞。
典型子模式:
参见今日 2607.05744 MCP 安全论文:approval-view fidelity gap 是该类失败的新变体。
评估体系本身的系统性缺陷,导致 benchmark 成绩无法可靠预测真实能力。
典型子模式:
论文明确指出,以下领域已有可信赖的进展(不受上述失败模式严重影响):
| 领域 | 进展程度 | 说明 |
|---|---|---|
| 单轮工具使用 | ✓ 显著 | 单次 function call 精度在主流模型上已较高 |
| 短周期 Web 导航 | ✓ 显著 | WebArena 等 benchmark 上 SOTA 已接近实用 |
| 窄范围编程任务 | ✓ 显著 | 单文件/单函数的代码生成和调试 |
| 长周期多 agent 任务 | ✗ 不稳定 | 失败模式 ①②③④ 的共同受害区域 |
| 跨工具依赖链 | ✗ 仍薄弱 | 工具调用链 >3 步后可靠性急剧下降 |