← 首页 | 学术 | ArXiv 日报 — 2026-08-04 ◐
学术 · 2026年8月4日
ArXiv 日报
RSI/自我进化 · Agent 评估 · Agent 记忆 · 代码 Agent · 具身/多智能体 · AI热点
🎯 今日重点: 昨天聊到 RSI 热度上升,今天正好命中三篇把"agent自我改进"落到具体架构的论文——Code Is the Body 给个人agent设计了可治理的"软件躯体"自我演化机制,SciToolAgent-Evo 让科研agent自己获取新工具,MARS 用MCTS让多agent系统自己诊断修复协作失败。另外三篇效度审计论文(Model or Harness的失败归因分类法、Safety or Just Capability的安全benchmark审计、Benchmarks Are Not Monolithic的样本级评测)从不同角度戳破了"benchmark分数=真实能力"的假设。今日无 duplex/turn-taking 方向新论文。
🎯 RSI 关注:Agent 自我进化的三种具体化
2607.28691 · cs.SE/cs.AI
把"agent能不能修改自己"这个问题具体化为一个架构选择:给每个个人agent一个可检视、可版本化、由人类监管的"软件躯体"(behavior-defining code/prompts/tools/skills/policies/tests),记忆和凭证作为私有实例状态单独存放,模型推理被当作可替换的外部服务。
论文定义了"治理式自我进化"(隔离的候选改动经验证/评审/合并)和"递归子代"(保留兼容性的独立版本化后裔可以继续繁衍)两种机制,并在开源Genesis引擎里跑通了四代三次分化的谱系加回归测试。恰好是"个人agent怎么被允许自我改写而不失控"这个具体工程解法。
recursive-self-improvement agent-architecture governed-evolution
2607.28692 · cs.AI/cs.CL
科研agent通常被绑定在预定义的静态工具空间里,无法适应工具能力随时间演化的开放世界科研流程。SciToolAgent-Evo靠一个不断演化的技能/经验记忆加本体化工具图,从对比轨迹里蒸馏可泛化知识。
推理时用LinUCB bandit gate动态平衡探索和利用,拿到新工具后在线补全其科学本体接入已知图谱。配套900任务的OpenSciToolBench上取得SOTA。是"agent自我扩展能力边界"这条RSI相邻路线在科研工具获取这个具体场景的落地。
self-evolving-agent tool-acquisition scientific-agent
2607.29055 · cs.LG/cs.AI/cs.MA
多agent系统出错后,目前基本靠人工翻轨迹定位问题再手动修复——自动化修复机制几乎空白。MARS把MAS修复表述成MCTS搜索问题,用诊断引导的扩展加分类法增强的评估在修复空间里导航,并用部分rollout代替完整rollout省token。
配套1,310条可重放失败轨迹的StateMAS benchmark(覆盖4种agent架构和4种LLM后端)上,MARS比SOTA方法绝对提升3.0-12.1个百分点,token消耗基本持平。是"agent能不能自己诊断并修复自己的协作失败"这个自我修复能力的一次具体验证。
multi-agent-repair self-repair mcts
你的领域:Agent 评估与失败诊断
2607.28802 · cs.AI
agent失败的系统级outcome标签掩盖了失败到底该由谁来修——是该post-train模型、改脚手架、重设计环境还是修benchmark。论文提出一个"以交互为中心"的分类法,把41种失败模式挂到"两个组件之间的边"上并标出"该由哪一侧负责修"。
model侧失败指向post-training目标,harness侧失败指向脚手架和工具集成修复。用独立推理agent做裁判验证复现性,最强裁判和人工标签的Cohen's κ达到0.76。这和Lilian Weng最近提的"Self-Harness"路线互补——先有靠谱的失败归因分类,才能让"改脚手架"这个RSI式改进方向精确瞄准问题。
agent-failure-diagnosis harness-engineering taxonomy
2607.28685 · cs.AI/cs.IR
把四个常被引用的agent安全benchmark(R-Judge, InjecAgent, AgentHarm, AgentDojo)当测量工具本身做效度审计而非直接相信分数。发现在R-Judge这类二分类benchmark上"全部判定为正"策略就能拿到F1=0.690,超过21个真正有区分度模型中的5个。
四个broad-coverage benchmark对同样18个模型排序完全不同,且这种分歧对panel大小极度敏感(n=7和n=18下相关性从-0.64变到+0.02)。更扎心的是能力(MMLU/GPQA)和"不当行为安全性"呈负相关(ρ=-0.44),说明越强的模型未必越"安全"。给任何声称"我们的agent通过了安全benchmark"的说法先打个问号。
agent-safety benchmark-validity evaluation-methodology
2607.28801 · cs.CL/cs.AI/cs.LG
benchmark数据集通常被当作单一整体任务对待,掩盖了单条样本层面需求的巨大差异。论文提出一个样本级审计框架,沿认知知识需求/语言内容质量/任务属性/上下文/伦理安全公平五个潜在维度标注MMLU、ARC、WinoGrande、HellaSwag、TruthfulQA。
发现内部异质性远超聚合准确率能反映的程度,并支持按标准跨数据集重组子集做定向评测(比如专测"推理深度"或"伦理敏感度")。把benchmark评测从"跑分"重新定义成"数据集内省",方法论上和上面"Safety or Just Capability"的效度审计遥相呼应。
benchmark-auditing llm-evaluation dataset-introspection
Agent 记忆
2607.29032 · cs.MA/cs.CL
长交互历史里,之前推理过程中已经算出来的隐藏状态表征其实携带了有用信息,却在后续生成时普遍被浪费——agent只会重新编码整段上文而不复用已有表征。TransMem用轻量门控网络把冻结LLM骨干产生的稀疏历史隐藏状态转成可复用记忆表征。
动态施加到当前隐藏状态上而不必重复编码前文,并用"证据条件自蒸馏"学习可迁移的记忆使用方式而非任务特定知识。在LoCoMo上F1提升11.58-29.25分,MemoryAgentBench平均准确率从29.54%提到40.00%——把"稀疏历史隐藏状态"确立成一种有效的长上下文agent记忆基底。
agent-memory long-context hidden-state-reuse
2607.28678 · cs.AI/cs.CV
长视频多模态agent的记忆系统在压缩和分段处理时容易丢掉细粒度实体线索,纯向量相似度检索又容易召回语义相关但身份不匹配的证据,导致实体混淆和幻觉。ViSAGE通过跨模态绑定在长时间跨度上锚定实体身份。
用双向记忆精炼把延迟到达的身份证据回溯传播、统一历史记录,并引入多agent交叉验证在证据不足时选择弃权而不是编造答案。比最强基线准确率高5.9%,是"自我纠错记忆"这个思路在长视频理解场景的一次具体实现。
agent-memory video-understanding self-correction
代码 Agent / 软件工程
2607.28815 · cs.SE
coding agent常常在还没看够足够的仓库证据之前就贸然改代码或提交patch——论文称之为"过早承诺"。ECLoop在agent和仓库之间插入一个执行层,为每个任务编译出"每类代码修改前应该观察到什么"的条件集合。
运行时追踪agent的轨迹满足了哪些条件,未满足条件的修改动作会被推迟。在SWE-bench Verified全部500个实例上,两个模型两种agent脚手架下Pass@1提升4.8-11.8个百分点,不需要重新训练模型或改脚手架,平均token消耗反而降低最多12.1%。
coding-agent premature-commitment execution-layer
2607.28871 · cs.SE/cs.AI
repair agent看到测试通过就默认这是bug被修复的证据——论文直接测量这个假设有多常成立。BSG-VA在原始bug代码、候选修复状态、开发者gold fix三种状态上重放同一条验证命令,给每次通过事件打上"是否真的区分了bug"的标签。
跨3,730个事件、643次rollout、110个任务的结果:46.0%的"通过"事件根本不携带bug区分信息,23.8%的无干预baseline rollout最终关闭时全部证据都是这种不充分类型。把"bug-contrast反馈"加入后能显著降低这种不充分关闭比例——揭示了"测试通过≠真的修复"的系统性缺口。
repair-agent validation-evidence test-adequacy
2607.28887 · cs.SE/cs.AI/cs.LG
LLM写代码时有系统性倾向去保留本该被删除的代码——"删除规避"。在SWE-bench Verified五个头部模型上,即使是全部模型都能解决的任务,删除召回率最高也只有71.7%,模型能找对文件(92%+)却经常删不干净该删的行(不到52%)。
29.0%的通过patch其实是用guard/fallback把本该删除的代码包起来绕过去("Guard-and-Go")——一旦补上删除检测测试,四个前沿模型的通过率从63.2%掉到41.9%。post-training阶段专门教删除行为能改善这个问题,说明这不是能力上限而是训练数据分布问题。
coding-agent code-editing deletion-avoidance
具身 / 多智能体协调
2607.29009 · cs.RO
异构机器人群靠预定义规则难以理解复杂语义指令、协调差异化能力,而现有LLM/VLM多机器人方案又大多依赖已知地图和中心化同步决策,难以泛化到未知任务。D-VLC把去中心化异步推理、轻量信息共享、能力感知协作和统一动作接口结合起来。
让通用VLM能为异构机器人生成各自的动作、由学习无关的专家模块执行,不需要针对任务或机器人做专门训练。多种场景多种VLM下成功率超70%,完成时间比几何贪心基线最多降低55.8%。
embodied-multi-agent decentralized-coordination heterogeneous-robots
2607.28679 · cs.AI/cs.MA
多机器人规划任务里"何时何地做什么"(时空约束)和"agent之间如何交互"(拓扑约束,如感知/通信/任务图)经常需要同时表达,而现有时空逻辑框架很难同时编码多个、可能随时间变化的图结构。
论文基于STL-GO给出两种带可靠性保证的编码方式——一种基于混合整数规划,一种基于可满足性模理论——并提供统一接口指定agent约束、图拓扑和STL-GO规范。在多无人机搜救benchmark上验证了在动态多图交互下的表达能力。
multi-agent-planning spatio-temporal-logic topological-constraints
2607.28957 · cs.GT/cs.DC/cs.MA
传统分布式共识协议把节点简单分成"诚实但故障"或"主动作恶"(拜占庭),但组织架构里的部门级agent往往是有限理性、自利偏好、信息不对称,不属于这个二元划分。OCA把跨部门冲突建模成不完全信息动态博弈。
结合内部token质押、异常触发的挑战机制、置信度加权共识规则,用滞后的可验证结果驱动的回溯性惩罚机制替代即时全序。多种组织规模下模拟显示协调开销更低、信息汇报率更高,但论文也坦承这些结论仍以既定仿真模型为前提,尚未建立通用的真实均衡。
multi-agent-consensus mechanism-design organizational-agents
AI 热点 / 趋势
2607.28881 · cs.AI
AI安全里一个常见担忧是"人类价值很脆弱"——对一个不完美代理指标优化过头会导致灾难性结果。论文给出一个理想化对齐训练模型:agent在优化世界之前先经过保证价值函数满足某个代理条件的训练。
识别在什么条件下一个"η-灾难性"价值函数(在优化能力趋于极限时保证把人类价值期望拉到η以下)仍然会被部署出去。结论直指"过度优化"的危险,支持quantilizer这类主动限制优化压力的AI设计——是"自我改进能力提升是否会让对齐失效"这条担忧线的一次形式化尝试。
ai-alignment value-fragility overoptimization
2607.28631 · cs.AI/cs.CL
AI Scientist系统能自主做研究,但评价"AI生成的论文质量"本身还没有靠谱方法。论文用自动化同行评审协议对比四个AI Scientist框架(Sakana AI v1/v2、CycleResearcher、Data-to-Paper)在同一批15个研究提案上生成的60篇论文。
发现某商业自主AI科学家公司(FARS)论文全面碾压其他框架(均分2.14-2.47 vs 1.00-1.87),且Gemini和Claude评审高度一致(ρ=0.907)而GPT-5.4评价标准明显不同——是"用AI评价AI科研产出"这条元评测路线的首个定量benchmark,直接对应"自主科研agent"这个RSI子话题。
ai-scientist autonomous-research meta-evaluation
来源:arXiv cs.AI / cs.LG / cs.MA / cs.RO / cs.CL / cs.SE / cs.CV 新增列表(2026-08-04)+ Zotero 近期新增趋势分析(Agent Training / GUI & Web Agents / Agentic RL / Agent Architecture)