← 首页|学术|ArXiv 日报 — 2026-07-17(补发)
学术 · 2026年7月17日(补发)
ArXiv 日报
Agent 架构 · Agentic RL · Agent 记忆 · 具身 VLA
本期为 7/17 定时任务因脚本抓取失败(标题字段为空)而补发,经 arxiv listing 页面重新抓取候选并核实摘要后完成。7/18 日报将随后续正常任务另发。
Zotero 近期新增集中于:GUI & Web Agents、Agent Training、Agentic RL、Reward Design
Agent 架构 / 多智能体
2607.15257 · cs.AI
把"搜索进度"从隐式对话历史变成显式共享状态:Frontier Task、Evidence Graph、Coverage Map、Failure Memory 四类持久化结构,配合 pipeline-parallel 调度让子 agent 之间复用未完成的覆盖缺口任务。
核心洞察:多 agent 系统失败往往不是能力不足,而是"进度追踪"本身没有被建模为一等公民。
agent-architecturemulti-agentstate-management
2607.15193 · cs.AI
把 GUI agent 的 plan 和 replan 过程外部化为可见、可编辑的持久化 artifact,而非藏在模型内部推理里。六人形成性研究发现大量 GUI agent 失败在"plan 可见+可局部修改"的条件下是可修复的。
为 agent 可监督性提供了具体的交互设计范式,而非仅停留在评测层面。
gui-agentagent-architecturehuman-in-the-loop
2607.14658 · cs.AI
用 DAG 取代线性推理轨迹:前端 decomposer 把复杂查询拆成视觉接地的原子节点,按依赖关系组成 DAG 实现严格上下文隔离,并引入自适应原子裂变——运行时对超出工具能力边界的瓶颈节点动态细分。
数学/物理/化学 benchmark 上显著超过线性 agent 框架,是"结构化推理状态"思路的另一个变体。
agent-architecturedag-reasoningscientific-reasoning
2607.14573 · cs.AI/cs.SE
面向真实支付集成这一 repo 级复杂任务:agent 需要选型、实现前后端协同流程、验证支付结果、维护事务与业务状态一致性。9 个产品项目、18 个任务实例,Basic/Advanced 两档场景。
提供 skill 后平均 RPR 提升 10.31 个百分点——量化"结构化指导对 coding agent 有多大帮助"的产业级 benchmark。
code-agentbenchmarkpayment-integration
2607.14277 · cs.CL
在冻结的 LLM/VLM 隐藏状态轨迹上加一个轻量层,直接从潜在生成过程推断"继续/求助更强模型/澄清/调工具/弃权"等部署时控制信号,无需修改模型本身。
路由系统中减少 90.7%(AndroidWorld)的大模型调用量,工具调用决策质量提升 158%——"决策信号能否从隐状态直接读出"的正向证据。
agent-architectureroutinginterpretability
2607.14119 · cs.CL
命名并量化了一种多 agent 级联的失效模式:中间 agent 在做"批判性评估"这类语域转换时会系统性压缩下游决策所需的语义区分度(fact-checking 场景下标签可分性下降 41.7%),而"原样传递"几乎不损失。
五种架构变体做因果分离,证明是"定向语义转换"本身而非压缩幅度决定输出偏移方向——设计多 agent pipeline 中间层提示词时值得警惕的坑。
multi-agentfailure-modesafety-evaluation
2607.14570 · cs.AI/cs.CR
面向没有资源维护复杂学习型监控 ensemble 的普通团队,提出 Information Flow Graph(IFG)监控器:用控制流/数据流图 diff 而非纯代码 diff 分析基础设施层面的"任务达成但暗中破坏安全性"。
异步场景把未训练 git diff 监控的漏检率从 11.6% 降到 3.5%;同步实时回滚模式把联合任务+隐蔽破坏成功率从 74.4% 压到 0%,且不影响正常任务完成率。
agent-safetycode-agentmonitoring
Agentic RL / Agent Training
2607.14777 · cs.CL
解决 outcome-based RL 里"轨迹级奖励对中间决策指导稀疏"的问题:让策略模型本身分析已完成轨迹,提炼出自然语言"事后技能"(hindsight skills),再把技能带来的动作概率偏移转成 token 级 on-policy distillation 信号,与 outcome RL 联合优化。
策略更新的同时技能提炼质量也在演化,两者同步提升——少数把"经验总结"直接转化为稠密训练信号而非仅存入记忆库的做法。
agentic-rlself-evolvinghindsight-learning
2607.14614 · cs.LG
用 reference-guided 分布和普通生成分布之间的 token 级对比差异做 correctness-aware advantage shaping(CPO),理论和实验都表明这个差异能可靠指示 token 级正确性,并解决了 RLVR 常见的 zero-advantage 问题。
证明 On-policy Distillation 是 CPO 的特例;正确/错误响应天然分别支持探索和利用,两者平衡时效果最佳。
agentic-rlrlvradvantage-estimation
2607.14506 · cs.LG/cs.AI
首个十亿参数规模 RLVR 微调的非平凡泛化界:用 PAC-Bayes 压缩界 + Gumbel-max 重参数化处理 token 生成的随机性。配套 Progressive RLVR 框架在保留 84-97% 标准 LoRA 微调性能的同时把模型压缩 14796 倍。
跟同期调研的 Ring-Zero(trillion-scale zero RL)互为补充——一个探规模上限,一个做理论下限的严谨刻画。
agentic-rlrlvrgeneralization-theory
2607.14952 · cs.LG/cs.DC
指出推理系统已逼近百万 token 上下文,而 RL 后训练大多仍停留在 256K 以下、依赖部署时长度泛化——这个 gap 对 agent 场景(观察/工具输出/历史决策持续累积)尤其致命。
用无 autograd 评估共享 prompt、逐分支 replay 短响应,在 8×H20 上做到 210 万 token 位置的 GRPO 训练,32×H20 验证 210 万 token prompt 跨 GLM-5.2 全部 78 层的端到端执行路径。
agent-traininginfrastructurelong-context
Agent 记忆
2607.14327 · cs.CL/cs.AI
现有压缩方法要么过早决定保留什么、要么依赖外部压缩器,导致压缩后的上下文难以适配后续推理步骤真正需要的证据。PReM 把长上下文当作模型内部逐层 KV 记忆维护,用专门的 memory layer 做选择决策,特殊 token <m> 触发刷新。
32K 上下文、16x/32x 压缩下均优于强 baseline,兼顾答案质量与推理效率。
agent-memorycontext-compressionkv-cache
2607.14252 · cs.RO/cs.AI/cs.CL
提出 Embodied Action Memory(EAM):形成-巩固-检索生命周期 + 四类记忆库(环境、实体、活动、推断知识)。在线编辑维护物体身份和状态历史,离线巩固把重复经验抽象成可复用流程。
在 EPIC-KITCHENS-100 扩展的 45 小时视频、18 名参与者上评测,记忆评估准确率比最强对照基线提升最高 20.5 分。
embodiedagent-memoryplanning
具身 / VLA / 实时控制
2607.14695 · cs.RO
Flow matching VLA 的迭代去噪特性与实时机器人控制存在根本冲突:全局 timestep 注入让 KV-cache 失效。Reflex 利用"timestep 不变性"把 attention context 分成静态/滑动/动态三区,实现 O(1) 增量 cache 更新;配合 AdaRMSNorm 防止高频推理下的数值坍塌。
LIBERO/Kinetix 上 2.58× 推理加速,50Hz 稳定流式推理,反应延迟降 54%。思路上和全双工交互的"边推理边响应"问题高度同构,值得对照 duplex agent 的时间片设计。
embodiedvlareal-time-inferencestreaming
2607.14852 · cs.RO
用双时间尺度 LoRA gating 把 VLA 终身学习拆成短期适配(可塑性)和长期巩固(稳定性)两条轻量通路,用 task-aware gate 显式控制两者权衡;配合无需存储完整轨迹的 cache-efficient 随机回放策略。
真实 xArm 机器人部署验证了技能扩展和已学行为保留的效果,降低对重新训练的依赖。
embodiedvlalifelong-learning
来源:arXiv cs.AI / cs.CL / cs.LG / cs.RO listing(2026-07-17)+ Zotero 近期新增趋势分析