← 首页|学术|ArXiv 日报 — 2026-07-15
学术 · 2026年7月15日
ArXiv 日报
Agent Architecture · Agent Training · Code Agent · Embodied AI
今日主线:训练信号设计的多个新角度——自验证作为 RL 奖励(SVR-R1)、最优停止截断 CoT(OS-Pruner)、在线蒸馏工程化(EasyOPD)、合成数据幽灵迁移风险(Phantom Transfer)。代码 Agent 侧出现两篇实证研究:SE agent 从业者调研 + agentic 代码合并后命运测量。具身方向:条件激活 VLM 推理与 Duplex Agent 问题高度同构。
你的领域
2607.09748 · cs.DC cs.AI
将分布式系统中的状态机复制(SMR)概念推广到 agentic 场景:传统 SMR 假设确定性状态转移,但 LLM agent 的随机性使精确比特复制失效。提出"信念状态复制"框架,以认识论状态(epistemic state)为一致性目标替代比特一致性。对 multi-agent 协调和容错推理有根本性影响。
Agent ArchitectureDistributedMulti-Agent
2607.09794 · cs.AI cs.LG
系统研究 LLM 从复杂上下文中学习并应用新知识的能力——前沿模型在新颖规范下仅 24% 任务成功率。瓶颈在于模型无法自主识别"哪些上下文是任务规范",提出 SDS 框架让 agent 主动提炼规范再执行。上下文学习的推理时 generalization 还有很大空间。
Context LearningAgent ArchitectureInference-Time
2607.10966 · cs.AI cs.CV
多轮 RL 框架:模型先给出答案,再用同一权重发出二元自验证判断(Yes/No),"No" 触发第二次尝试。自验证本身成为学习信号,不依赖外部 verifier。与 Recon 的内在逻辑相似——用模型自身认知一致性作为训练信号,是 reward hacking 风险较低的内在奖励路径。
RLSelf-VerificationMultimodalAgentic RL
2607.11012 · cs.LG cs.CL
在线蒸馏(OPD)的工程化框架:在学生模型自己生成的 rollout 上收集教师/评估者监督,解决固定离线数据与不断演化的学生策略之间的分布漂移。与 Behavior Priming 互补——前者关注用什么行为来蒸馏,本文关注如何高效实现在线蒸馏管道。
关联 Behavior Priming:EasyOPD 提供了在线蒸馏的实现框架;结合 Behavior Priming 的行为筛选准则,可构造"行为质量导向的在线蒸馏"。
DistillationOn-PolicyAgent Training
2607.11089 · cs.AI cs.LG
用最优停止理论解决 CoT "过度思考"问题:在推理过程中动态检测"继续思考的边际收益是否值得",达到停止条件时提前截断。不依赖任何额外训练,纯推理时干预。对 Duplex Agent 的 Thinking Layer 也有参考——何时截断异步推理是实时交互的核心约束之一。
InferenceChain-of-ThoughtEfficiency
代码 Agent / 软件工程
2607.11042 · cs.SE cs.AI
专门评测 agentic LLM 生成"含后端服务"的完整软件制品(API 集成、数据库交互、服务部署)——填补了现有 benchmark 几乎全测单文件或单函数的空白。涵盖检查文件、执行命令、观察失败、迭代修改等完整 agentic loop,是目前最接近真实后端开发场景的评测。
Code AgentBenchmarkBackend
2607.11046 · cs.SE cs.IR
agentic bug localization 中,将代码检索粒度从文件级细化到函数/方法级,引入为检索优化的代码表示。发现精细粒度检索显著提升 agent 在 repository-level 任务中的定位精度。检索质量是代码 agent 性能的隐性瓶颈之一。
Code AgentRetrievalBug Localization
2607.10856 · cs.SE cs.AI
对实际开发 SE agent 的从业者进行混合方法研究(访谈 + 案例分析),揭示实践中的真实模式、常见陷阱和设计决策。这类关于"人们实际怎么做"的实证研究在 agent 工程领域极为稀缺,是 benchmark 研究的重要补充。
SE AgentEmpiricalPractitioner Study
2607.09902 · cs.SE cs.AI
首次系统研究 agentic coding 工具生成的代码在合并后的长期命运——之前的评测几乎全部停在 pre-merge(PR 接受率/review 难度)。发现 agent 生成代码的维护性和 bug 出现率等指标与人工代码存在显著差异。是评测代码 agent 时必须正视的生命周期视角。
Code AgentSoftware QualityLongitudinal
推理基础设施 / 安全
2607.10750 · cs.LG cs.AI
合成数据训练 agentic 行为时,即使过滤掉所有有害动作,"幽灵迁移"(phantom transfer)仍可能将合成数据中的隐性分布偏差传递给模型。与 Behavior Priming 的反直觉结论遥相呼应:数据的行为分布比表面的正确性更难控制——这对所有依赖合成轨迹做 SFT 冷启动的流程都是警告。
关联昨日精读:Behavior Priming 指出"行为质量 > 结果正确性";Phantom Transfer 进一步警示"行为分布的隐性偏差在显式过滤后仍然存在"。两者合读是合成数据安全性的完整图景。
Synthetic DataAgentic RLSafety
2607.10795 · cs.IR cs.AI
在多跳 QA 的 search agent 中引入证据压缩模块:在每步检索后动态压缩累积的证据,防止 context 无限增长导致的噪声和延迟问题。是 WebSailor 类 web agent 架构在推理效率上的互补方向——WebSailor 解决"怎么搜",STEC 解决"搜到的东西怎么管"。
Multi-Hop QAEvidence CompressionInference
GUI / Web Agent
2607.10531 · cs.HC cs.AI
主动 web workflow 发现:不等用户明确说"自动化这个",而是从用户的浏览行为中自动识别可自动化的重复模式,然后生成自动化脚本。解决了"用户不知道自己能自动化什么"的冷启动问题。是 proactive agent 的一个罕见的实用化方向。
Web AgentWorkflow AutomationProactive
2607.10621 · cs.SE cs.AI
前端 repo 级代码生成:设计知识(design knowledge)与代码实现在多轮迭代中共同演化,agent 在每次 commit 后更新其对 repo 设计规范的理解,避免后续修改破坏已有约定。在长时域 agent 中维护隐式规范的一种实用方法。
Web AgentCode AgentFrontend
具身 / VLA
2607.10991 · cs.RO cs.AI
条件激活的 VLM 推理:在社会导航中,RL policy 决定"何时需要调用 VLM 进行深度推理",而不是每帧都推理。推理成本降低,实时响应性提升。与 DuplexOmni 的"何时切换 Interaction/Thinking Layer"问题高度同构——都在解决"推理资源按需分配"这个 Duplex 架构的核心约束。
关联 DuplexOmni:该论文的"条件推理激活"是 Duplex Agent 在具身场景下的外化——同样的问题在对话场景中是 480ms 时间片的切换决策,在导航中是 RL policy 的 trigger 决策。
EmbodiedVLMSocial NavigationDuplex
2607.11027 · cs.RO cs.AI
分段轨迹扩散:介于连续动作预测(短视野、误差累积)和离散关键姿态(不够连续)之间的中间路径——将轨迹分段后各段独立扩散生成,保持段内连续性同时允许段间的灵活跳转。在机器人操控的轨迹质量和适应性之间找到了实用的平衡。
Robot ManipulationDiffusionTrajectory
ArXiv 日报 2026-07-15 · 今日新增 326 篇 | 精选 15 篇 · 高松灯