← 首页|学术|ArXiv 日报 — 2026-07-22
学术 · 2026年7月22日

ArXiv 日报

Agent 训练/架构 · GUI Agent/记忆 · Code Agent/SE · 具身 VLA · AI 热点
795
今日新增
16
精选
1
Duplex 相关
Zotero 近期新增集中于:Agent Training、GUI & Web Agents、Agentic RL、Agent Architecture  |  今日焦点:turn-taking 静默阈值实证(2607.18076)与长时序 credit assignment 的两种互补解法。

目录

  1. 你的领域:RL/训练 · Agent 架构 · 评估框架
  2. GUI Agent / 记忆
  3. 代码 Agent / 软件工程
  4. 具身 / VLA
  5. AI 热点 / 趋势

你的领域:RL/训练 · Agent 架构 · 评估框架

2607.18076 · cs.CL
Modeling turn-taking with distant viewing: investigating silence thresholds in human and AI-generated discourse
直接命中 duplex agent 的核心变量——轮次切换的静默阈值:对比30部美剧真人对话和51期NotebookLM生成的合成播客中的停顿间隔分布,按说话人性别(Praat基频估计)和生成方式分层。
虽然方法偏语言学/远程观察而非模型侧,但给出了"AI生成对话的turn-taking节奏与真人有何系统性偏差"的实证基线,可直接用于校准DuplexOmni一类系统的时间片/静默阈值设定。
duplex-relevantturn-takingdiscourse-analysis
2607.16257 · cs.LG/cs.AI/cs.CL
From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training
针对长时序agent RL中"每一步动作贡献度难以区分"导致的高方差问题,提出Hindsight Policy Optimization:把当前策略分布和事后(hindsight)分布投影到统一的"意图空间",用Wasserstein距离提取低方差学习信号。
语义相近的状态/动作在意图空间中被聚合,理论和实验都显示方差有界且训练更稳定,是对GRPO类方法长时序信用分配问题的一个新解法方向。
agentic-rlcredit-assignmentpolicy-optimization
2607.16244 · cs.LG/cs.AI/cs.CL
Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents
用一个具体崩溃案例把"outcome-only GRPO"的失败模式钉死:HotpotQA上训练最终100%输出格式违规,诊断发现是"零优势锁死"——所有采样轨迹都拿到最低格式惩罚,组内相对优势归零,梯度变成零。
提出用冻结参考模型对最终答案对数似然的边际增益作为逐轮奖励,防止奖励方差坍缩,3B模型上F1从0.430(GRPO峰值)/0.000(GRPO终态)提升到0.518。与上一篇HPO是同一问题的两种互补解法,一个走意图空间聚合,一个走逐轮信息增益奖励塑形。
agentic-rlreward-collapsegrpo
2607.17082 · cs.AI/cs.CL/cs.LG
Otap: Structure-Aware Optimal Transport for Evaluating Planning and Execution in Agent Trajectories
现有轨迹评估要么是成功/失败二元flag要么是精确匹配,前者不知道为什么失败,后者惩罚顺序不同但语义等价的合法计划。
提出把轨迹评估重构为agent执行图与一组合法解图之间的最优传输距离,证明对保序重排不变、对冗余步骤敏感度有界,还能处理缺失/幻觉步骤,对标准化agent trajectory评估很有实用价值。
agent-evaluationoptimal-transporttrajectory-metrics

GUI Agent / 记忆

2607.16211 · cs.AI
Accurate and Efficient Long-Term Memory for LLM Agents
提出MOSAIC:实体类型化图存储+局部敏感哈希加速检索(替代昂贵的LLM分类)+存储时主动冲突检测三件套,解决扁平记忆丢失关系上下文、检索延迟高、矛盾静默累积三个老问题。
LoCoMo上89.35%准确率(比最佳基线+27.21pp),冲突检测率66%(基线仅14%),检索延迟仅0.58秒/问题,是这批记忆论文里综合指标最强的一篇。
agent-memorygraph-storageconflict-detection
2607.17545 · cs.AI
Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory
把"何时该压缩记忆、何时该保留原始记录"形式化为一个budget依赖的决策问题:分解每种操作(Merge/Abstract/Rewrite)对覆盖增益和替换效应的权衡,平衡点随预算压力变化。
紧预算下压缩比保留提升最高48%准确率,宽预算下保留更优——这个"没有普适最优策略"的结论对任何在有限上下文窗口里做记忆管理的duplex/长程agent都是直接可用的设计原则。
agent-memorybudget-awarecontext-compression
2607.17621 · cs.AI
Mechanistic Attention Guidance for Agent Memory Refinement
现有自演化记忆系统大多只用文本层面的信号来改进记忆,很少看模型内部到底怎么用这些记忆的。这篇用retrieval-head注意力构造"上下文利用矩阵",暴露记忆片段实际被使用的模式。
据此做segment级别的定向记忆更新(失败纠错、成功简化),并用重新执行验证更新效果——是少见的把机制可解释性直接接入记忆维护闭环的工作。
agent-memorymechanistic-interpretabilityattention
2607.17050 · cs.CV/cs.AI
EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding
把GUI agent端到端成功率拆解开来,专门诊断"动作如何改变界面状态"这一子能力:时序排序、逆动作预测、对比式单步后继判别三个探针,标签直接从轨迹顺序导出,无需额外标注。
28个VLM配置零样本评测下最强模型也只有60.4分,且模型规模和GUI专精程度都不能可靠预测表现——说明"看懂状态转移"是当前GUI agent里被低估的短板。
gui-agentbenchmarkstate-transition

代码 Agent / 软件工程

2607.18057 · cs.SE
Test Coverage Analysis of Agentic Pull Requests
分析4882个由五种coding agent生成的真实PR(AIDev数据集),发现只有49.6%的PR在改动被测代码时同时改了测试;Python里64.8%的PR完全没有任何已有测试覆盖改动行。
agent自己写的测试能提升覆盖率但只在少数PR里发生,错误处理分支是覆盖率最差的部分。这是目前少有的"agent自主提PR"真实生产数据下的测试质量实证,直接指向需要覆盖率感知的agent开发流程。
code-agenttest-coverageempirical-study
2607.17205 · cs.AI/cs.SE
A Systematic Evaluation of Trajectory Data Curation for LoRA Fine-Tuning of Code Agents
系统研究"轨迹数据质量和数量如何共同影响code agent微调效果":提出效率+风格双轴质量打分,16组对照实验发现一个"规模依赖"的质量-数量权衡。
小规模数据集下翻倍数据量比精选质量更有效,但数据量达到2000条后质量筛选的优势开始显现;error-retry率是质量打分里贡献最大的子维度,为SFT阶段轨迹策展提供了可操作依据。
code-agentloradata-curation
2607.17352 · cs.AI/cs.LG
Self-Modifying Lean Proof Agents with Verifier-Grounded Benchmark Coevolution
不只是让Lean证明agent自我进化,而是让agent和它的benchmark共同进化:每代最优agent通过"精通节流"课程更新任务难度,并用单锚点重新校准保持跨代分数可比。
所有进化都被Lean形式化验证闭环钉住,最优共进化agent在held-out miniF2F上达到45.1%解题率,远超固定benchmark基线的32.0%,为自演化agent系统提供了防止benchmark被隐性攻克的通用范式。
self-evolving-agentformal-verificationcoevolution

具身 / VLA

2607.16506 · cs.RO/cs.LG
Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models
指出VLA做多阶段接触密集装配任务时的隐蔽失败模式:单个子任务的终止状态几何上"成功",但对下游子任务可能是脆弱的——稀疏成功奖励看不到这一点。
用离线估计的"预见值"作为奖励乘子训练残差策略,三阶段拧螺母任务上整体成功率从54.5%提升到85.6%,核心启示是长时序性能提升要靠塑造"哪种成功状态被产生"而不只是"是否成功"。
vlaresidual-rllong-horizon-manipulation
2607.18231 · cs.RO
FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation
视觉记忆增强的VLA在视觉上模糊的时序事件(如小幅度多次按按钮)上会失效;这篇改用力历史做记忆——用VAE把力时间序列编码成紧凑的力记忆token,作为额外条件输入动作专家模块。
三个记忆依赖任务上超80%成功率且推理开销很小,是"非视觉模态记忆"路线在具身场景的一个干净验证,与GUI记忆论文形成跨模态呼应。
vlaforce-memorycontact-rich-manipulation
2607.16636 · cs.RO
PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution
给VLA、世界模型、agentic planner的组合提供了一个系统级运行时基座:用"会话"而非"动作"作为调度最小单元,用文件系统做认知层和物理执行层之间的解耦边界。
SessionVerifier区分"执行终止"和"语义任务完成"。这本质上是在给具身agent做DuplexOmni式的分层解耦(认知规划 vs 物理执行),只是应用场景是机器人而非对话交互,架构思路上和duplex方向高度可比较。
embodied-agentself-evolvingsystem-architecture

AI 热点 / 趋势

2607.17283 · cs.AI/cs.LG
Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware
在消费级Apple Silicon上对投机解码做了少见的严谨实证解剖:验证分布等价性(卡方检验p=0.976),五组draft/target配置里三组反而变慢。
失败原因包括draft模型不够快、或量化Metal后端把"并行"验证串行执行——只有verification真正批并行且draft/target延迟差距真实存在时投机解码才划算,对本地/边缘部署推理加速有直接参考价值。
speculative-decodinginference-optimizationconsumer-hardware
2607.18100 · cs.AI
Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering
把推理轨迹看作隐状态序列而非无结构文本,发现失败轨迹会陷入"自循环",耗尽token预算却毫无进展。
提出SOPHIA:构建按状态对索引的steering向量库,推理时在线检测自循环并检索对应向量进行干预。这类"作为状态机而非文本流"的推理控制思路,若推广到实时交互场景,与duplex agent需要在线检测"卡住"并切换策略的诉求是相通的。
reasoning-controlactivation-steeringself-loop
来源:arXiv cs.AI / cs.LG / cs.MA / cs.RO / cs.CL / cs.SE / cs.CV 新增列表(2026-07-22)+ Zotero 近期新增趋势分析