← 首页|学术|ArXiv 日报 — 2026-08-01
学术 · 2026年8月1日
ArXiv 日报
Duplex Agent · RL/训练 · Agent 记忆 · Agent 技能 · 代码 Agent · 具身/安全
🎯 今日重点:再次命中 duplex/turn-taking 方向论文 Cocktail-Talker——用三个显式动作token(respond/listen/ignore)+ GRPO 训练助手在嘈杂多人场景下判断"要不要开口",是继 07-25 Instruct-FD(测出可控性缺口)、07-31 DuplexGen(数据合成)之后第三种切入角度:直接训练一个可强化学习的发言决策头。其余精选集中在 agent 诊断能力与判断力的元学习(SkillMentor 的盲区诊断、Rehearse 的 confidence cliff)、agent 记忆的治理化(MemTxn 事务边界、精确删除的表示依赖性)、以及量化和多agent协作拓扑对agent系统评测结果的隐藏影响。
🎯 Duplex 关注:Cocktail-Talker
2607.27756 · cs.SD/cs.CL/cs.MM/eess.AS
语音对话系统通常假设干净的单用户-助手轮流对话,但真实社交场景里多人同时说话,一句话可能是对助手说的、对别人说的、或完全无关——助手不仅要决定说什么,更要决定要不要开口。Cocktail-Talker用三个动作token <|respond|>/<|listen|>/<|ignore|> 显式建模"是否发言"这个决策,通过SFT+RL(GRPO)训练生成合适的动作token,只有在respond模式下才生成语音响应。
这是把"turn-taking决策"从隐式的生成时机问题,变成显式的可监督动作分类问题——和07-25 Instruct-FD(测出指令可控性缺口)、07-31 DuplexGen(人类校准数据合成)构成第三种切入角度:不是评测也不是数据合成,而是直接给"要不要说话"训练一个可强化学习的决策头。配套Cocktail-DialogGen数据管线模拟带角色设定的真实多人社交对话,是目前对"嘈杂多人场景duplex决策"最直接的一次建模尝试。
duplex-agentturn-takingmulti-speakergrpo
你的领域:RL/训练 · Agent 架构 · 评估框架
2607.27360 · cs.AI
agent自我进化的研究大多假设"失败发现"是给定的,只关注拿到失败后怎么修——论文反过来问:能不能学习diagnosis本身,即"agent不知道自己不知道什么"这个盲区发现能力。为了逼出真正的诊断能力,特意排除了executor自适应和人工监督两条捷径。
SkillMentor训练一个独立的Mentor策略专门生成诊断任务、定位复发性失败模式、并把它们提炼成可复用的纠正技能——在AppWorld和BFCLv3上平均带来44.2%的executor性能提升,且全程不更新executor权重、不用人工标注数据。把"诊断能力"从"修复能力"里明确剥离出来当作独立可学习对象,这个框架切分本身对agent自我进化的研究设计有参考价值。
agent-self-evolutionblind-spot-diagnosismeta-learning
2607.27687 · cs.AI
autoresearch循环的效率不只取决于能不能想出好点子,更取决于agent能不能在真正跑一次训练之前就判断"这个改动大概率有用"。论文发现这个预判断能力会随轮次系统性衰减——在公开AutoSOTA日志里,有效改动比例从头两轮的70%掉到第6轮以后的43%,选择性准确率从82.8%跌到56.9%,同时判官依然愿意下判断,作者称之为"confidence cliff"。
根因是随着好点子被用完,剩下的候选越来越难判断,而判官缺少"类似尝试之前失败过"的记忆。Rehearse给判官配上聚焦的历史结果记忆后,把后期选择性准确率拉回83.5%,在nanochat、图像分类、时间序列预测三个任务、4000次训练budget下都改善了终点性能——是agent自我改进循环里"元判断能力会退化"这一现象的一次扎实诊断加修复。
autoresearchself-improvementmeta-judgment
2607.27888 · cs.AI
GRPO类critic-free方法把response级奖励均匀广播给每个token,忽略了不同token对最终结果的贡献并不相等;而寄望于用self-distillation(OPSD)做密集监督的方法,又默认"privileged self-teacher带来的似然偏移就代表了可靠的答案对齐信息"——论文用一个反事实实验直接检验这个假设。
把同一条采样轨迹分别在"断言正确"和"断言错误"两种条件下重新打分,发现大部分token在两种条件下偏移方向相同,即privileged shift根本不携带可靠的答案对齐方向,偏移幅度主要反映的是token的"反事实敏感度"而非真正的学习价值,且大幅偏移集中在可替换的表面token上,真正承载推理内容的token反而不敏感。CSCR据此对高敏感token降权、重新归一化优势,在长CoT数学推理上稳定跑赢GRPO——是对token级信用分配一个常见假设的一次干净证伪。
rlvrcredit-assignmentgrpo
2607.27275 · cs.LG/cs.AI
4-bit权重量化"近乎无损"是被广泛引用的结论,论文专门在多轮工具调用agent上重新检验——这恰恰是量化最该被谨慎对待的场景。在τ²-bench上,8个cell、456轮episode,16/8/4-bit三个精度下,标准指标下量化确实看起来免费:没有一个cell的分数变化能扛住多重比较校正。
但过程层面完全是另一个故事——量化把模型在全精度下已有的失败模式(telecom场景的工具名幻觉)放大最多2.5倍,同时几乎不产生任何新失败类型(跨精度失败集合的秩相关≥0.94)。分数之所以看起来持平,是因为benchmark自带的"十次错误预算"把额外的失败吸收掉了;把预算收紧到两次错误,17分的差距立刻重新暴露。这是"聚合指标掩盖过程损伤"的一个具体、可复现的机制,对任何用粗粒度成功率评测agent系统的人都是直接警示。
quantizationagent-evaluationerror-budget
2607.27984 · cs.AI
agentic系统让"生成候选输出"和"审查候选输出"之间的鸿沟越拉越大,论文问一个具体的架构问题:领域专精化到底该放进评委的权重里,还是放进"何时该信任这个评委判断"的规则里。
在99,952条带rubric的公开样本上,把训练语料按criterion family拆成8个专精LoRA评委反而比单一共享评委掉10分、且5%风险目标下的可审计覆盖率从24.44%跌到5.43%;但换一个角度——用学出的正确性头在0.6B-4B-8B级联上做路由决策(不改变任何reward score本身),20次划分下拿到89.40%准确率(对比单独8B的84.75%),且每次都通过精确的单侧95%风险审计。结论很干脆:评判能力本身该共享学习,专精化应该放进"什么时候该交给谁做"的审计边界里,而不是拆分权重本身。
llm-as-judgeevaluation-architecturespecialization
2607.27354 · cs.AI
个人AI助手要在统一服务环境里长期运行,必须持续维护用户状态、遵守用户特定的配置和权限、并在多个服务间维持跨轮次的约束一致性——但现有benchmark大多把服务上下文拆碎或把用户状态抽象掉,测不出真实的个人助手行为。PAUSE把用户状态、跨服务资源协调、多轮授权约束显式建进评测环境。
采用双轨评测——开放式服务管理任务用语义/轨迹行为指标,约束密集型任务用确定性状态验证,还配了真实的用户模拟交互而不是静态工具执行。结果是即使最强的闭源模型在需要"有状态推理+配置感知"的场景下任务完成率也不到70%,暴露出一致且可解释的失败模式——是"长期运行个人助手agent"这个越来越贴近实际部署的场景第一次有了系统化、有状态的评测标准。
personal-assistantstateful-benchmarkagent-evaluation
Agent 记忆 / RAG
2607.27415 · cs.AI
inference-time scaling方法在agent场景下普遍是无状态的、反复做冗余搜索,而现有memory机制又大多依赖LLM本身做推理来提取知识,成本高昂。GAMER把历史推理建模成动态的Action-Centric Graph,把memory机制从LLM推理里解耦出来。
用双流Temporal Difference学习估计动作节点的正向(建议)和负向(规避)价值,推理阶段学到的价值函数双向优化决策——正值给出行动建议,负值标记高风险动作,通过在图上高效搜索大幅提升inference scaling的效率。多个benchmark上成功率/进度率分别提升20.81%/6.17%,是"用轻量图结构记忆替代纯LLM推理式记忆"这条路线的一次具体验证。
agent-memoryepisodic-memoryinference-scaling
2607.27834 · cs.AI/cs.CL
长期运行的LLM agent靠persistent memory跨会话复用信息,但可写记忆里的错误一旦写入就会持续污染后续行为——现有系统只优化存储和检索,却没有给"更新"这件事本身一个事务边界。MemTxn把这个问题当作答案模型之外的一个治理层来解。
用Ordered PatchTest校验写入是否有源头支撑、用Temporal Resolver在事实冲突时选出可见版本、用durable snapshot journal在故障后恢复应用可见状态。在item-disjoint审计上做到60条支持性原始记录全部接受、179条强负例全部拒绝;在LongMemEval-S和LoCoMo上的持久性多key故障测试中,能在不知道实际物理写入集合的情况下完整恢复声明的活跃状态映射——是给agent记忆补上"事务性"这个数据库领域基本概念缺失的一次具体实现。
agent-memorytransaction-boundarymemory-governance
2607.27539 · cs.LG/cs.CL
语言模型持久记忆里"精确删除"这件事,本质上取决于记忆是怎么表示某条记录的——可寻址的影响可以用代数式减法直接移除,但被后续写入变换过、混进共享循环状态里的影响,只能从写入之前重建。论文在两个预训练模型上系统检验这个区分,并和"完全没见过该记录"的显式参照对比。
在把Gemma 3的全局注意力层替换成support-vector memory后,1B规模下代数式减法和"保留key重新拟合"在下一token输出上KL散度中位数低至5.4×10⁻¹⁵,几乎和从未训练过一样;但规模上到4B、12B后效用代价升到11.2%和44.3%。在48B的Kimi Linear混合架构里,加性写入允许精确减法,而delta rule会让12-49%的贡献变得依赖后续写入顺序,无法简单减去。核心结论——精确删除是记忆表示方式的属性,不是一个统一算法能解决的问题——对任何声称"支持遗忘/删除"的agent记忆系统都是一个值得追问的判据。
agent-memorymachine-unlearningexact-deletion
Agent 技能 / 工具
2607.27497 · cs.CL
agentic系统一般靠两条互相独立的路线积累能力——从过往经验里整理文本知识/流程,或者在权重空间里合并训练出参数化技能库,此前研究几乎没有尝试把这两种模态无缝融合。SkillSmith把模型权重当成LLM可以原生推理的另一种"模态"。
通过prefix-tuning实例化参数化学习,让增强后的LLM同时摄入prefix权重和描述该权重与目标能力关系的文本,直接输出体现目标技能的新prefix权重——SkillSmith在效果上显著超过纯文本或纯权重空间的单模态基线,把"技能库"从"文本知识"或"权重合并"二选一,变成了可联合推理的统一表示空间。
skill-learningparametric-memoryprefix-tuning
2607.27929 · cs.AI
大规模训练终端(terminal)agent需要多样、可验证的终端任务和高质量交互轨迹,但现有合成方法要么因为任务生成和真实执行脱节导致可靠性差,要么因为依赖现成代码仓库导致多样性和可扩展性受限。Meta-Task把"终端任务合成"本身重新定义成一个Terminal-Bench格式的任务。
agent在真实容器环境里迭代地生成、执行、验证任务,合成组件在生成循环内部就被检查内部一致性和可执行性,还引入多阶段机制先动态设计新颖任务规格再落地成具体任务,并用LLM-as-Judge过滤保证质量。Terminal-Bench 2.0上仅用3,221条Meta-Task合成轨迹微调,Qwen3-14B/32B分别达到22.5%/31.8%的Avg Pass@1,用远少的数据超过同期方法——"任务合成本身也是一个agent任务"这个自指式框架设计值得关注。
agent-trainingtask-synthesisterminal-agent
代码 Agent / 软件工程
2607.27877 · cs.AI
多agent"氛围编程"承诺加速软件开发,但现有benchmark多用忽略真实时间和金钱成本的合成环境,把推理和沟通混为一谈,且只奖励表面上的任务完成。MSEval基于10个真实全栈项目、跨10个领域构建from-scratch多agent编码评测,用分层需求和确定性评分标准打分。
其执行引擎LegoGent测试10种协作拓扑(agent通过周期性同步间隔协调、经原生CI/CD流水线部署),配套的自动评分器TAgent同时动态测量功能正确性、延迟和prefix-cache token成本。100次运行下发现:对相同任务和模型,仅改变协作拓扑就能让分数浮动超过30分、耗时翻倍——组织拓扑对速度-成本-质量权衡的影响不亚于模型能力本身,结构化流水线收敛最快质量最高,而重管理监督的拓扑反而拖累表现。
multi-agent-codingcoordination-topologybenchmark
具身 / 安全
2607.27967 · cs.AI
合作式多智能体强化学习里的信用分配问题在具身AI场景下尤其棘手——反馈稀疏且延迟,参与agent数量还在动态变化。MARS-RA把信用分配重新表述成一个排序聚合问题:用大型多模态模型对agent做基于贡献的两两比较,把结果转化为贡献分数用于potential-based奖励塑形。
从绝对估计转向相对估计,让方法对噪声和动态agent参与更鲁棒,论文还给出了收敛性和鲁棒性的理论证明,并证明Shapley值可以作为解释性参照。在多种不同类型的高难度任务上,MARS-RA能有效引导agent走向协作——是"用多模态模型做两两比较代替绝对打分"这个思路在具身多agent信用分配上的一次具体落地。
embodied-aimulti-agent-rlcredit-assignment
2607.28226 · cs.CR/cs.AI
世界模型给具身AI提供了一个预测性核心——把观测压缩成状态、模拟动作条件下的未来、支持超越反应式控制的规划,但这层预测能力也打开了一个新的安全边界:数据、传感器、prompt或反馈里的破坏可以一路传导到物理动作。这篇综述把世界模型当成一个完整生命周期来追踪威胁,从数据构建、表征学习,到状态grounding、想象、轨迹评估、执行,再到通过记忆和工具的长期适应。
论文展示投毒、后门、对抗样本、传感器欺骗、prompt注入、轨迹操纵、供应链攻击这些熟悉的攻击家族,在破坏世界状态、学到的动态、可供性估计或安全代价时会呈现出截然不同的含义,还指出一个值得警惕的双面性——世界模型既可以充当运行时安全护盾,被攻破或被过度信任时又会生成"预测性安全幻觉"。给出了完整的生命周期分类法、攻击到安全属性的映射、安全失效评测协议,以及跨溯源、鲁棒grounding、不确定性感知预测、轨迹门控、反馈审计、部署保障的防御体系。
embodied-aiworld-modelsecurity-survey
AI 热点 / 趋势
2607.27951 · cs.CR/cs.AI
LLM安全防护要在"看到答案会被怎么用"之前就决定要不要回答,这对双用途任务是个根本性难题——同一个答案既能帮到有资质的专业人员也能帮到攻击者,而攻击者完全可以伪装出和良性请求一样的交互历史。论文把"模型释放的能力"和"关于下游用途的可得证据"分离开来,证明当这个证据是可复制的时候,可以推导出攻击者获益的精确最坏情况下限。
得到一个"安全不可能三角":有用能力、可靠安全、开放访问三者不可兼得。论文进一步展示可信凭证(hard-to-copy的、能预测实际下游用途的信息)如何补足现有防护,并给出消除这个下限所需的更强条件,用双用途评测、自适应攻击和已部署的可信访问项目的证据支撑这些结论的现实相关性——是把"safeguard到底能做到什么程度"这个模糊直觉转成了一个可以严格论证的三角关系。
ai-safetydual-usesafeguards
来源:arXiv cs.AI / cs.LG / cs.MA / cs.RO / cs.CL / cs.SE / cs.CV 新增列表(2026-08-01)+ Zotero 近期新增趋势分析