← 首页|学术|ArXiv 日报 — 2026-07-23
学术 · 2026年7月23日
ArXiv 日报
RL/训练 · Agent 架构 · GUI Agent/记忆 · Code Agent/SE · 具身 VLA · AI 热点
Zotero 近期新增集中于:Agent Training、GUI & Web Agents、Agentic RL、Agent Architecture | 今日未发现明确的 duplex/turn-taking 论文(已做专项关键词扫描),焦点转向 RL 奖励信号精细化(路径级/证据级/step级三种互补方案)与代码修复 agent 的探索策略竞赛。
你的领域:RL/训练 · Agent 架构 · 评估框架
2607.19345 · cs.CL/cs.AI
长上下文推理里一个此前被忽视的失效模式——模型把推理过程写成"抄输入"而非真正求解,且上下文越长越严重。提出GEAR:在准确率奖励基础上叠加"关键证据重合度"奖励和"干扰项重合度"惩罚。
多个规模上比标准RLVR提升最高4.6分。这类"reward shaping显式对齐推理过程与证据"的思路,和下面几篇"RL训练里如何精细化学习信号"的主题一脉相承。
agentic-rllong-contextreward-shaping
2607.19313 · cs.CL/cs.AI/cs.LG
针对RLVR"越难的题模型越拿不到任何正确解、梯度直接归零"的学习悬崖问题,提出用带特权提示(如解题前缀)生成rollout,再用重要性校正objective把更新拉回无提示的原始目标。
数学推理基准上比vanilla GRPO平均提升13.8%(相对),额外开销可忽略——是"如何给RL训练里最难的样本注入学习信号"这一老问题的一个干净解法。
agentic-rlgrpoprivileged-information
2607.18979 · cs.LG/cs.AI
并行多路推理里outcome-level奖励对所有路径一视同仁,导致冗余、误导甚至有害的路径和真正贡献的路径拿到同样的学习信号。把每条路径视为合作博弈的玩家,用Shapley值量化边际贡献。
配合生成式奖励模型打分+蒙特卡洛近似,在数学推理基准上训练更稳定、更可解释。和上面两篇一起构成"RL奖励信号精细到路径/证据级别而非只看最终结果"的三重奏。
agentic-rlshapley-valueparallel-reasoning
2607.18915 · cs.CL/cs.AI
提出一个新颖的幻觉分类——"情境敏感事实幻觉":模型明明具备相关知识,却因推理过程中的上下文干扰而在长链条中出错。用多次rollout计算逐步自一致性作为step级奖励(SSC-GRPO)。
在数学推理和幻觉排行榜上都拿到SOTA。是这批RL训练论文里唯一专门瞄准"模型知道但推理时忘了"这一细分故障模式的。
agentic-rlhallucinationstep-level-reward
GUI Agent / 记忆
2607.18659 · cs.CR/cs.AI
系统性测量LLM浏览器agent对主流bot防御(hCaptcha/reCaptcha v2v3/Cloudflare Turnstile)的绕过能力:挑战式防御对商业验证码解码服务和配备专用solver的agent基本无效。
reCaptcha v3这类非交互式信任防御看起来更抗打,但细粒度轨迹分析发现真正决定因素是执行环境的真实性而非agent行为本身——对GUI/浏览器agent的实际部署安全边界给出了少见的实测证据。
gui-agentweb-securitycaptcha
2607.19096 · cs.AI
把agent记忆workload拆成事实查找、关系链/现状推理、长历史综合三类,用冻结语义分类器+运行时门控把每次查询路由到三条通路之一,共享同一套多粒度embedding+三元组+事实版本元数据的底层substrate。
在LoCoMo/MemoryAgentBench/LongMemEval三个基准上都有扎实数字,论文也坦诚承认因果路由效果、效率增益的证据目前不足——是一篇诚实披露局限的路由式记忆架构工作。
agent-memoryrouted-architecturebenchmark
2607.18975 · cs.AI
面向手机/车载/家居/穿戴设备等多端Personal AI场景的生命周期记忆框架,把记忆定位为"连续性与治理substrate"而非对话缓存——强调纠错/遗忘、策略演化边界、隐私与端云延迟约束。
四个角色(Structure/Expansion/Evolution/Deployment)靠统一审计契约串联,MemStack在LoCoMo/PersonaMem-V2/LongMemEval上给出可控评测数字。和上一篇都在做"记忆系统的可审计性",但落点互补。
agent-memorypersonal-ailifecycle-framework
代码 Agent / 软件工程
2607.18754 · cs.SE/cs.AI
把agent调试形式化为Detect-Attribute-Recover-Rerun闭环,核心的DeepDebug模块通过全局轨迹理解+结构引导调查+交叉验证做多轮根因诊断。
Who-and-When基准上严格归因准确率28.8%(优于最强单轮基线21.7%),GAIA上单次重跑修复73个失败任务中的13个。配套开源工具链并提供共享调试记忆——把"agent失败定位"本身当成可复用能力沉淀。
code-agentdebuggingroot-cause-analysis
2607.18859 · cs.SE/cs.AI
指出现有issue修复agent的核心短板是"探索不足"——候选编辑位置探索有限、每个位置的修复尝试也不够。用多智能体框架做多位置采样+迭代反思精炼+基于历史尝试蒸馏的终轮生成。
SWE-bench-Verified上相对SWE-agent提升最高7.8%,MiniMax-M2.5下Pass@1达76.0%。和AgentDebugX一起说明代码修复agent的竞争点正从"能不能修"转向"探索策略够不够系统"。
code-agentswe-benchrepair-strategy
2607.18886 · cs.SE/cs.AI
面向复杂多功能点需求的端到端代码生成,五个角色agent中Validator Agent维护一张连接需求-设计-代码的异构可追溯性图,既做一致性校验也当作高效记忆的结构化上下文。
在ETOUR和SMOS上成功率分别达53.63%和56.82%,比基线最高提升340.80%——把"需求可追溯性"显式建模为图结构,是repository级代码生成里值得注意的记忆/校验融合思路。
code-agentrequirement-traceabilitymulti-agent
2607.18550 · cs.SE/cs.AI
首次系统量化"bug报告里的行为线索能在多大程度上传递到测试和补丁":用结构化行为锚点+多种相似度指标+LLM判断,分析Defects4J和SWT-Bench共2857组report-test-patch三元组。
发现完整diff是判断报告-补丁对应关系最稳定的基础,且两个LLM相对人类都系统性偏乐观——为"用LLM自动判断bug修复对不对"的可靠性敲了个警钟。
code-agentbug-resolutionllm-evaluation
具身 / VLA
2607.18709 · cs.RO
在RoboInter1.0基础上扩展的具身世界建模中间表示套件:23万+操作episode、571个场景,每帧标注子任务/原子技能/物体-夹爪定位/分割/可供性/抓取姿态/接触点/运动轨迹等十余种中间表示。
核心主张是把这些中间表示当作"双向接口"——既regularize底层动作空间,又约束开放世界物理模拟器的隐式rollout。是具身数据集/中间表示这条线里目前标注维度最全的一个。
embodied-aiworld-modelingintermediate-representation
2607.19190 · cs.RO/cs.AI
用视觉语言agent自动化real2sim转换——把真实世界的物体-机器人交互录像转换成可仿真"episodic twin",覆盖刚体操作、可变形物体交互、类人动作三类此前需要各自独立pipeline的场景。
agent决策可用开源权重VLM驱动,成本仅为前沿模型的一小部分却达到相近的转换成功率,目标是为下游策略学习和评测提供真实对齐的仿真环境。
embodied-aireal2simvision-language-agent
2607.18985 · cs.RO/cs.AI
面向端上部署的8B具身"机器人大脑":通用监督微调→通用RL→具身专家训练→模型合并四阶段后训练流水线,目标是在保留通用能力的同时获得强的高层具身交互能力。
相比同规模Qwen3-8B思考模型,通用基准表现相当但输出显著更短,具身基准上甚至超过部分规模大得多的模型——紧凑模型+精简输出对延迟敏感的实时交互场景有直接参考价值。
embodied-aion-deviceefficient-inference
AI 热点 / 趋势
2607.19321 · cs.AI/cs.CR
随着AI agent开始自动化AI研发本身,如何评估一个"可能不可信"的agent产出是否能安全部署,成为AI control的新战场。覆盖安全后训练、能力后训练、CUDA核优化、推理服务优化四类长时序任务。
给每个主任务配上"嵌入式破坏"和"独立隐蔽任务"两类隐藏side task。核心发现:藏在训练数据里的破坏最难抓,监控器即使能做实验探测仍会漏检——是"agent自动化研发"趋势下一个扎实的安全评测基础设施。
ai-safetyagent-monitoringai-control
2607.19336 · cs.AI
一篇教程性质的综述,聚焦agentic系统从研究原型到生产级部署过程中暴露的鲁棒性/安全性/可靠性新挑战,用制药研发和金融系统两个真实案例分析成功部署的共同设计模式。
和ResearchArena一起呼应"学术界重基准和算法创新,但真实部署带来的挑战完全是另一个维度"这一今日暗线,为本期收尾提供了一个"从实验室到生产"的整体视角。
agentic-aideploymentindustry-practice
来源:arXiv cs.AI / cs.LG / cs.CL / cs.RO / cs.SE / cs.CR / cs.MA 新增列表(2026-07-23)+ Zotero 近期新增趋势分析