← 首页|学术|ArXiv 日报 — 2026-07-25
学术 · 2026年7月25日

ArXiv 日报

Duplex Agent · RL/训练 · Agent 记忆 · Code Agent/SE · 具身/世界模型
259
今日新增
16
精选
1
Duplex 命中
🎯 今日重点:发现一篇直接命中 duplex/turn-taking 方向的强相关论文 Instruct-FD——首个评测全双工语音系统"能否按指令控制交互策略"的基准,最强模型指令遵从率也只有 64.4%,量化了"交互流畅"与"交互可控"之间的差距。其余精选集中在 agent 记忆生命周期化、GRPO 奖励设计陷阱、代码agent安全评测(IssueTrojanBench × GuardianAgentBench 同日出现)与具身持续记忆评测空白。

目录

  1. 🎯 Duplex 关注:Instruct-FD
  2. 你的领域:RL/训练 · Agent 架构 · 评估框架
  3. Agent 记忆 / RAG
  4. 代码 Agent / 软件工程
  5. 具身 / 多智能体世界模型

🎯 Duplex 关注:Instruct-FD

你的领域:RL/训练 · Agent 架构 · 评估框架

2607.21503 · cs.AI
Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
生产环境里agent失败往往不是推理能力不足,而是管不住上下文——对话历史、大prompt、工具定义、膨胀的工具输出。
论文认为把这当成"存储与检索问题"的传统框架太窄,主张把上下文管理当作生命周期和架构问题来解,是对agent memory这个老话题的一次范式级重新定义。
agent-memorycontext-managementarchitecture
2607.21419 · cs.AI/cs.LG
PATS: Policy-Aware Training Scaffolding for Agentic Reinforcement Learning
长时程agent RL里弱策略容易反复犯同样的错误,产生无信息量的rollout轨迹。已有skill-centric方法围绕"技能本身"做优化,而不是围绕"当前策略需要什么样的训练支持"。
PATS把技能重新定义为动态训练脚手架,是"以策略演化为中心"而非"以技能库为中心"的一次视角转换。
agentic-rlskill-learningtraining-scaffold
2607.21273 · cs.LG/cs.AI
The Dark Room in the Reward Channel: Dense Prediction Rewards Collapse GRPO-Trained LLM Agents -- and What Actually Works
稠密的逐步奖励看似是稀疏奖励长时程agent的合理补救——奖励agent预测下一步观测——但论文展示在GRPO下这个配方不只是失效,而是彻底摧毁策略:预测准确率冲到1.0但任务成功率归零,陷入"黑房间"病态。
这是对"预测型内在奖励"这条常见思路的一次冷水泼头式反例,附带给出了真正有效的替代方案。
agentic-rlreward-designgrpo
2607.21461 · cs.AI
AREX: Towards a Recursively Self-Improving Agent for Deep Research
深度研究任务需要同时满足多重约束,发现答案代价高但验证候选答案往往可以拆解成可行的逐约束检查。
AREX利用这种"发现-验证不对称性",让agent交替进行内部验证和基于部分验证状态的迭代优化,而不只是单纯搜索更久,是把验证信号系统性地反馈进搜索过程的一次尝试。
deep-researchself-improvementrecursive-verification

Agent 记忆 / RAG

2607.21106 · cs.AI/cs.LG
AttriMem: Attribution-Guided Process Feedback for Agent Memory Learning
现有记忆构建策略要么靠主观启发式规则,要么靠RL但只用粗粒度的outcome级奖励,无法定位究竟哪部分中间记忆内容真正支撑了最终答案。
AttriMem引入归因引导的过程反馈,把"哪些记忆有用"这个信用分配问题细粒度化,是记忆学习从"结果监督"走向"过程监督"的具体尝试。
agent-memorycredit-assignmentprocess-feedback
2607.21404 · cs.AI
MemTools: A Unified Research Framework for Interoperable Agent Memory
Agent记忆系统研究长期受限于架构碎片化——各实现把记忆生命周期的不同阶段耦合在一起,评测逻辑又和具体数据集绑死。
MemTools用声明式数据契约把记忆生命周期标准化,让不同记忆类型/组件可以互换组合,是这个领域少见的"先把基础设施做对"的工作,对后续横向比较各家记忆方案很有价值。
agent-memoryresearch-infrastructureinteroperability
2607.20458 · cs.CL/cs.AI
CAMeR: Keyword-Gated Hybrid Activation for Adaptive Memory Retention in LLM Agents
长对话agent面临"全记还是均匀遗忘"的两难,两种策略都无法区分相关和无关信息。
CAMeR用符号(词级Jaccard)+子符号(embedding余弦)的混合门控机制计算记忆-查询相似度,再配合自适应权重动态调整保留强度,是记忆筛选机制上一次务实的工程化改进。
agent-memoryretention-policyhybrid-gating
2607.21324 · cs.CL/cs.AI
GRADRAG: Cross-Component Prompt Adaptation for Coordinated Multi-Agent RAG
多agent RAG系统里各组件(检索器、生成器等)大多被孤立优化,缺乏跨流水线的协同改进。
GRADRAG把RAG流水线建模成计算图,让评估器产生的结构化反馈能传播回上游各agent(包括检索器、图构造器),是"端到端可微式"提示优化在多agent RAG上的一次落地。
ragmulti-agentprompt-optimization

代码 Agent / 软件工程

2607.20972 · cs.SE/cs.AI
Delivery, Not Storage: Cue-Anchored Working Memory as a Harness Property for Coding Agents
现有代码agent的记忆只有一种——文档(指令文件、计划产物、自动记忆目录),都需要agent主动选择写入和读取。
论文指出人类专家真正依赖的是第二层从不写下来的记忆——情境触发、非自主检索的操作性事实(坑点、位置、局部约定),主张这一层才是长时间运行agent的关键,必须是harness的内建属性而非存储设计问题。
code-agentworking-memoryharness-design
2607.20911 · cs.SE/cs.AI
Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction
覆盖代码、Web、Office、安全四个工作域的代码agent评测套件,每个任务都是从真实commit/PR/业务场景逆向改写成口语化角色扮演请求,而非直接套用公开issue文本。
专门针对性解决benchmark污染问题,是工业界评测方法论上的一次扎实贡献。
code-agentbenchmarkcontamination-resistant
2607.20759 · cs.CR/cs.SE
IssueTrojanBench: Benchmarking AI Coding Agents Against Malicious Issue Requests
代码agent的安全风险来自两端——LLM本身(对抗prompt/后门触发器诱导生成恶意代码)和agent架构本身(工具自主性带来的API滥用/数据外泄)。
这篇系统性评测代码agent面对"恶意issue请求"的鲁棒性,和今天的GuardianAgentBench一起构成"agent安全评测"的同类工作,反映这条线正在快速工程化。
code-agentsecuritybenchmark
2607.20982 · cs.AI/cs.CR
GuardianAgentBench: Where Agents Fail and How to Guard Them
针对LangChain/LlamaIndex/Vectara三个生产级框架构建的580场景对抗性评测基准,涵盖六个领域和五种攻击模式。
最强配置也只能拿到74.8%整体准确率,暴露出两类系统性失效模式,是当前agent安全防护现状的一份诚实体检报告。
agent-safetybenchmarkadversarial

具身 / 多智能体世界模型

2607.21588 · cs.RO
AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation
机器人操作策略学习需要多样化高质量演示数据,但现有数据管线依赖专用硬件、集中式操作员或固定任务集,难以规模化。
AXIS用浏览器端遥操作实现大规模社区众包演示采集,并自动生成/校验新任务,把社区数据转化为训练就绪格式,是"众包式机器人数据引擎"这个方向少见的完整落地。
embodied-aidata-enginerobot-manipulation
2607.21571 · cs.RO/cs.AI
Beyond Episodic Evaluation: Memory Architectural Bottlenecks in Sequential Embodied Question Answering
具身问答一直按"每个任务独立求解、内部状态重置"的episodic范式评测,但真实机器人需要持续运行,跨episode积累和复用信息。
论文研究不同记忆架构在连续多轮EQA评测下的表现差异,填补了"具身agent持续记忆"这一长期被忽视的架构评测空白。
embodied-aiagent-memorysequential-evaluation
2607.21594 · cs.CV/cs.MA
Streaming Multi-Agent Autoregressive Diffusion Model with World State Registers
多agent交互式世界模型不仅要生成一致的观测,还要维护跨agent、跨视角持续演化的世界状态。现有自回归视频扩散管线只能靠观测历史做条件生成,难以维持共享状态。
WorldWeaver引入跨agent世界状态寄存器——可学习token存储共享世界信息并追踪各agent状态,是"世界模型+多agent状态一致性"结合的一次具体实现。
world-modelmulti-agentvideo-diffusion
来源:arXiv cs.AI / cs.LG / cs.CL / cs.RO / cs.SE / cs.CR / cs.MA 新增列表(2026-07-25)+ Zotero 近期新增趋势分析