← 首页|学术|ArXiv 日报 — 2026年8月6日
学术 · 2026年8月6日

ArXiv 日报

批量精读模式 · 16 篇独立精读页 · Agent 失败诊断 / 可靠性 / 自我进化 / 多智能体
309
候选总数
~100
有效候选
31
全文抓取
16
精读发布
Duplex / turn-taking 扫描:0 命中。对已抓取的 31 篇全文摘要做了关键词扫描,未发现与全双工交互 / 打断-轮转直接相关的工作。但今日候选池中约 200/309 条因抓取脚本数据质量问题标题缺失,未能进入筛选与扫描范围,这个 0 命中不代表当天没有相关论文,只覆盖了约 1/3 候选池,此数据质量问题尚待诊断修复。
⚠️ 已知问题:arxiv-prefilter.sh 抓取结果中约 200/309 条候选标题/日期为空,本次仅从约 100 条有效标题中筛选,可能存在漏收。将在后续会一并诊断这个抓取问题。
目录
  1. 分组一 · Agent 失败诊断与自愈
  2. 分组二 · Agent 可靠性与工具调用
  3. 分组三 · 自我进化与代码 Agent
  4. 分组四 · 多智能体系统
  5. 📚 知识库更新

分组一 · Agent 失败诊断与自愈

Fail-Fast, Restart-Smart
cs.AI · 2608.03222
提出 0.6B 轻量 monitor,仅凭可观测的轨迹前缀(不碰策略模型内部状态)就能预测 SWE agent 是否会失败;触发后不是简单终止,而是同策略无历史重启,并把此前产生的 diff 作为"可选覆盖层"暴露给 agent 自行判断是否复用。在 SWE-bench Verified 上省 14.6%–20.4% 执行 token,并能把 Qwen3.6-27B 的解决率从 66.6% 拉到 71.8%——核心洞察是"失败可以提前预测"这件事本身是轻量、可跨策略迁移的能力,不需要依附在某个具体策略模型上。
SWE-Agent失败预测效率
TraceCompiler
cs.AI · 2608.02680
Agent反复执行同一类任务时会留下大量带噪声的工具调用轨迹。TraceCompiler的核心贡献不是"把轨迹变成流程图"这件事本身,而是一套极其保守的证据规则:只有当某次调用的参数值能被唯一追溯到此前某次调用的输出时,才承认两者存在依赖,观察到的先后顺序本身从不作为证据。这让编译出的工作流可审计、可拒绝——遇到无法证明依赖关系的分支(如不确定方向的增删操作),系统会主动放弃编译而不是赌一个大概率正确的顺序。
轨迹挖掘工作流编译技能复用
Don't Regenerate, Debug
cs.AR · 2608.02712
LLM生成硬件kernel(GPU/NPU算子)时,大量候选"编译通过、能跑起来,但数值验证失败"——这些near-miss候选目前被当成废料直接丢弃、重新生成。本文认为这是巨大的浪费:调试是比重新生成更受约束、反馈更密集的搜索问题。作者构建了一个引擎主导、agent仅负责修复(无验收权)的领域专用debug agent,在27个真实near-miss AscendC算子上把Pass@1从重生成的25.9%(Pass@3为40.7%)提升到66.7%,且每次成功平均节省92.8%的token。
硬件生成调试范式Token效率
CUADebug
cs.AI · 2608.02643
计算机使用agent(截图+鼠标键盘操作驱动)的失败往往是视觉感知、空间定位、底层交互、任务推理与环境动态多重耦合的结果,事后很难判断真正的根因在哪一步。CUADebug 用一套 CUA 专属错误分类体系 + 204条人工标注失败轨迹的 benchmark(CUAErrorBench)+ 主动检查式调试器(CUADebugger),把"事后追责"变成"可执行修复":根因诊断准确率从 11.2% 提到 19.6%,续跑成功率从 12.2% 提到 25.86%。
Computer-Use-Agent调试benchmark多模态诊断

分组二 · Agent 可靠性与工具调用

Verified Tool Calls Improve LLM Agent Reliability Under Non-Atomic Failures
cs.AI · 2608.02645
Agent 框架普遍假设工具调用是"原子的"——要么成功要么失败,二元清晰。但真实系统里超时、延迟可见性、部分写入这些"非原子"故障才是常态。本文提出一个不改模型本身、只改工具调用协议的验证层:后置条件校验 + 幂等键,把"报错就重试"变成"先问系统状态,再决定要不要重试",在模拟实验中把重复动作率从 72% 压到 20% 左右,同时任务成功率不降反升。
工具调用可靠性失败恢复
更短的推理,更早的答案?——推理接口评估
cs.CL · 2608.03401
缩短推理轨迹不等于提升推理效率——很多"更快得到答案"的方法本质上只是让模型提前停止思考。作者在匹配的推理预算下,对比"提示词要求简短"和"训练好的努力程度档位"两种缩短推理的范式,发现两者的效果差异巨大:简洁提示带来的收益小且不稳定,而训练出的低努力设置在同等长度下能显著保住更多准确率,说明"如何让模型变快"这件事,训练时机制内置 vs. 推理时提示引导,效果并不等价。
推理效率延迟早停
ADRS:自蒸馏奖励塑形
cs.LG · 2608.03223
用同一个冻结的行为策略快照,在"有/无特权技能条件"两种情况下分别对已采样的轨迹token重新打分,二者之差就是一个不需要额外标注、推理时也不依赖技能文本的稠密token级信用信号。把这个信号校准、门控后注入GRPO/GiGPO的优势计算,在ALFWorld、WebShop、多跳QA等长程多轮agent任务上持续超过纯轨迹级奖励基线。
奖励塑形信用分配RL
When Policies Change Probabilities
cs.SE · 2608.02677
用15,792条响应实证发现:当前LLM代码审查器普遍没能把"这个补丁失败的概率有多大"(风险估计,应只依赖证据)和"接受/拒绝的代价函数"(应由部署方决定)解耦——把提示词里的误接受代价从1:1改到10:1后,四个被测审查系统汇报的失败概率平均漂移13.6-16.9个百分点,导致高代价策略下的决策全面劣于"直接拒绝所有补丁"的零成本基线;作者提出的模块化流水线把概率估计和代价应用拆成两步后,误差和损失都显著下降。
代码审查决策架构风险评估

分组三 · 自我进化与代码 Agent

重新审视 Agent 技能的自我进化
cs.AI · 2608.02636
"技能自我进化"听起来像是 agent 在持续变强,但作者用受控实验拆穿了这个叙事的大部分成分:388 次候选修订里只有 55 次真正带来字节级不同的验证最优版本,且所有被最终选中的进化技能无一例外来自包含失败轨迹的反馈。更扎心的是,额外的测试时算力(并行采样、序列精修)在简单任务上几乎能追平技能进化的收益,但在需要持久化多步流程的任务上完全追不上——这说明技能进化的真实价值恰恰在于"把程序性知识固化下来",而不是单纯地多想几遍。
自我进化技能学习评测方法
Self-Evolving Coding Agents
cs.SE · 2608.03392
这是一篇综述:系统梳理"自我进化代码 agent"这一新兴方向,提出 object-centered 分类法(进化什么/何时进化/何种证据驱动),并指出可执行反馈、仓库级上下文、丰富的编码轨迹让软件工程天然适合做 agent 自我进化的试验场,同时点出 benchmark 过拟合、反馈可靠性、长期记忆退化、评测维度单一等尚未解决的挑战。适合作为该子领域的入门地图,而非某个具体新方法的论文。
代码Agent自我进化综述
MemArena
cs.AI · 2608.02613
面向端侧个人记忆助手的benchmark:用50个agent模拟15天、1030万+token的活动密集对话世界。核心发现——记忆后端的选择比阅读器模型规模化更能决定内容准确率;而"权限感知访问"这一维度在所有后端上都失败,Oracle检索过度泄露,其余后端又过度保守,"既能检索又能把关"的组合几乎不存在。
个人记忆助手端侧评测基准
PRWeaver
cs.SE · 2608.02693
给LLM代码审计agent一整段仓库历史访问权限,并不能防住把恶意改动拆散、混进良性PR洪流里的攻击者——当审计上下文里良性与恶意变更被迫共同呈现时,检测率会从逐PR审查的50-60%骤降到整窗审查的16-22%,说明"看得到历史"不等于"能防住蓄意隐藏"。
代码安全对抗攻击PR审查

分组四 · 多智能体系统

多智能体群体中的多元无知现象
cs.MA · 2608.02758
论文首次在 LLM 多智能体群体中系统性复现了社会学经典现象"多元无知"(pluralistic ignorance)——多数私下反对某规范的智能体,在群体讨论中仍公开表态支持,因为它们误以为自己是唯一的反对者。8 个来自 6 家机构的模型在 100 个场景上测试,公开顺从率普遍在 64%–94% 之间;即便注入一个敢言的"norm entrepreneur"(规范先驱者)打破虚假共识,多数模型的级联(cascade)成功率也低于 26%。这提示 LLM 社会模拟可能系统性高估社会规范的稳定性,忽略了真实世界中规范突变的临界点动态。
多智能体群体动力学社会认知
多智能体 LLM 辩论中偏见共识的相变涌现
cs.MA · 2608.02827
多智能体LLM辩论会放大单个LLM的偏见——但不是渐进的,而是相变式的。作者用统计物理的自旋模型(Ising/Potts)刻画辩论动力学,证明当"从众强度/噪声"比值 λρN/T 超过临界阈值时,群体会突然从中立跳变到集体偏见共识;异质性(混合不同模型/温度)能软化这个尖锐转变。理论预测在投资决策和LLM-as-judge两个真实任务上都得到验证。
多智能体辩论偏见涌现
并发 Agent 系统的有状态治理
cs.MA · 2608.02764
现有Agent安全护栏几乎都在"请求发起那一刻"做决策:这一刻预算够、库存够、审批状态对,于是放行。但从决策到效果真正提交之间,另一个并发请求可能已经把预算花完、把库存订光。论文把这种"决策依据的状态已经过期,但系统仍执行该决策"的现象命名为stale authorization(陈旧授权),并给出一个可形式化验证的正确性标准——policy-state serializability(PSS):要求每一个已提交的效果,都能被解释为"在它发生前那一刻的策略状态下是被正确授权的"。围绕这个标准,作者构建了运行时架构Provenact,把状态一致性检查从"策略作者手写补丁"变成"运行时通用机制"。
并发系统治理多Agent协调
关系先验是收敛压力,不是涨点手段
cs.MA · 2608.03239
用一种最简的 signed-network(正负号网络)形式化,把"信任/挑战/服从"这类关系语义显性写进多智能体系统提示词里,任务协议本身不变。结果发现这层关系先验主要起"收敛压力"的作用——关系越正向,agent 越容易达成一致;但这种一致跟"对不对"没有稳定的关系,客观问答类辩论里甚至会推高"正确性无关的一致"。作者的结论很克制:关系先验不该被当成多智能体系统的默认加分项,而应该是诊断性、按任务验证后才用的工具。
多智能体提示设计关系先验收敛陷阱

📚 知识库更新

今日知识库无更新(AgentTeam-Shared-Knowledge,checkpoint 与 HEAD 一致:cd612df3)。
数据来源:arXiv (cs.AI/cs.LG/cs.MA/cs.RO/cs.CL/cs.SE/cs.CV/eess.AS) · AgentTeam-Shared-Knowledge