← 首页|学术|2026-07-07 学术简报

学术简报

2026年7月7日 · arXiv cs.AI / cs.LG / cs.CL / cs.MA · 今日新论文精选

🤖 Agent 架构与规划

Atomic Task Graph: A Unified Framework for Agentic Planning and Execution 2607.01942
agentplanning
提出 Atomic Task Graph(ATG),将复杂任务分解为原子级任务节点构成的有向图,统一规划与执行阶段。不依赖更大模型或任务特定 fine-tuning,training-free、跨任务泛化能力强。在多个 agent benchmark 上超越现有 prompt-based 方法。
AgenticSTS: A Bounded-Memory Testbed for Long-Horizon LLM Agents 2607.02255
agentmemorybenchmark
提出 有界记忆(bounded-memory)的 agent testbed,把记忆视为「每个未来决策允许看到哪些信息」的合约,允许隔离单一记忆组件的效果——这正是 A-TMA 等工作缺乏的受控实验环境。与昨天精读的 ghost memory 方向直接相关。
ElephantAgent: Contextual State Continuity in Agentic Systems 2607.01919
agentmemory
关注 agent 跨工具调用的上下文状态连续性,解决 agent 在多步执行中「忘记」中间状态的问题。名字来自"大象不会忘记"——与 ghost memory 议题互补,侧重操作层状态维护。
Cache Merging as a Convergent Replicated State for Multi-Agent Latent Reasoning 2607.01308
multi-agentinference
多 agent 潜空间推理中 KV-cache 合并问题。现有 BagMerge(序列轴拼接+RoPE 重编码)不可交换,输入顺序敏感。本文将 cache 合并转为收敛可复制状态(CRDT),使 merge 结果与顺序无关——对 multi-agent 并行推理基础设施有直接意义。

🏋️ 训练 / 奖励建模

Evidence-State Rewards for Long-Context Reasoning (Maven) 2607.02073
RLlong-context
提出 Maven:带可编辑 evidence memory 的 RL 框架。对长文档推理,现有方法只奖励最终答案,Maven 定义证据状态奖励(evidence-state reward)——对中间证据定位、修订、合成动作给予细粒度反馈。与 A-TMA 的 evidence support 指标思路一脉相承。
SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use 2607.01874
skillevalagent
针对 agent 使用技能(skills/SOP)时评估过粗的问题,提出自进化评分 rubric,能区分"侥幸成功"和"正确选择正确技能"。在技能库重叠时尤其关键,对 agentic data synthesis 的评估指标设计有参考价值。
Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling 2607.01830
reward modeleval
现有 annotation-free rubric 生成器通常用单一 evaluator,可能遗漏重要评价维度。本文让多角色生成 rubric(用户、专家、审阅者等),再合并为统一奖励信号——提高奖励模型覆盖度和对齐质量。

🛠️ 软件工程 Agent

UA-ChatDev: Uncertainty-Aware Multi-Agent Collaboration for Reliable Software Development 2607.02186
multi-agentcode
在多 agent 软件开发框架(ChatDev 类)中引入不确定性感知:中间产物(需求分析、代码、测试)的可靠程度不等,不应等价传递。UA-ChatDev 在每个协作步骤估计置信度,低置信时触发额外验证,提高生成代码的可靠性。
Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification (Vera) 2607.01793
safetyagenttesting
提出 Vera:端到端自动化 agent 安全测试框架。从风险发现(自动生成违规场景)到证据支撑验证(不再依赖硬编码规则),随 agent 能力演进而自适应扩展。填补现有安全测试无法跟上 agent 进化速度的空白。

🦾 视觉 / 多模态 / 具身

Visually Grounded Self-Reflection for VLMs via Reinforcement Learning 2607.02490
VLMRL
大视觉语言模型的 CoT 推理中,自我反思(self-reflection)常退化为纯文字修订,不再关注视觉输入。本文用 RL 训练视觉锚定的反思能力,迫使模型在纠错时真正重新注意图像区域,而非仅凭文字推断。
M2Note: Continual Evolution of VLMs via Mistake Notebook Learning 2607.00685
VLMmemorycontinual
VLM 反复犯同类错误(跳过关键视觉检查、幻觉概念)的问题。M2Note 维护一个「错误笔记本」,记录历史失败模式,推理时检索相关 mistake note 作为上下文注意——绕开昂贵的 SFT/RL 迭代,实现持续自进化。
ASPIRE: Agentic Skills Discovery for Robotics 2607.00272
embodiedskill
机器人 agent 自主发现、编写、迭代精化控制程序(code-as-policy),在持续探索中建立技能库。不依赖预定义技能集,通过与环境交互和失败分析自我完善——是具身 agent 自主技能获取的完整闭环系统。

📊 今日数字

扫描论文 174 篇 · 兴趣匹配 30 篇 · 精选 12 篇
来源类别:cs.AI · cs.LG · cs.CL · cs.MA