← 首页|学术|AgentOPSD:面向Agentic强化学习的递归自蒸馏轮级信用分配
cs.AI · cs.LG · 2608.05987 · 提交于 2026年8月6日

AgentOPSD:面向长程Agentic强化学习的递归信念自蒸馏轮级信用分配
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

Zi-Han Wang, Zhengxi Lu, Zhiyuan Yao, Jinyang Wu 等(清华大学团队为主,含美团/腾讯等合作者,基于作者列表推断)
💬 长程多轮agent任务的强化学习普遍面临"轨迹级奖励难以定位关键决策轮次"的问题。AgentOPSD提出一种无需额外critic或rollout的递归信念更新机制,把师生模型的token级log概率差聚合为轮级信用信号,在ALFWorld上用Qwen2.5-7B取得89.1%成功率,超过GRPO与现有自蒸馏基线。

🎯 问题

轨迹级奖励掩盖了关键决策轮次
带可验证奖励的强化学习通常只构建轨迹级的优势估计,但在长程、多轮的agentic任务中,真正决定任务成败的往往只是其中少数几个关键决策点。用统一的轨迹级信号去训练,等于把这些"关键轮次"和大量无关紧要的中间步骤一视同仁地对待,credit assignment(信用分配)因而不够精准。近期工作引入了"特权自蒸馏"(privileged self-distillation)来提供更密集的监督信号,但这类局部信号究竟应该如何刻画"时序上的信用"仍不清楚——即:一个局部的师生差异信号,怎样才能被恰当地转化为对某一轮决策重要性的量化评估。

🔬 方法

Critic-free 递归贝叶斯信念更新
AgentOPSD 是一种无需额外critic、也不需要额外rollout的轮级信用分配方法。核心思路分两步:首先将token级别的师生(teacher-student)log概率差聚合成轮级证据;然后在log-odds(对数几率)空间中,递归地更新一个贝叶斯信念状态。这套机制把稀疏的结果监督(outcome supervision)转换为具有原则性的轮级信用信号,并通过比较相邻信念状态之间的边际信念修正量,识别出真正的"关键轮次"(pivotal turns)。整个方法与标准的策略优化完全兼容,可以直接插入现有RL训练流程。
评测设置
在 ALFWorld、WebShop、Search-QA 三个agentic任务环境上,用 Qwen2.5 模型的两个规模(3B 和 7B)分别验证方法效果,并将其与 GRPO 以及现有的强自蒸馏基线进行对比。

📊 结果

在三个环境上全面超越基线
AgentOPSD 在 ALFWorld、WebShop、Search-QA 上均优于 GRPO 与强自蒸馏基线,其中在 ALFWorld 上使用 Qwen2.5-7B 达到 89.1% 的成功率。消融实验将性能提升归因于两个设计要素:轮级信息聚合(turn-level aggregation)与历史依赖的递归信念更新(history-dependent recursive belief updates),二者缺一不可。

💡 我的看法

这篇论文处理的是长程多轮agent RL训练里一个很实际的痛点——credit assignment的粒度问题,用"信念状态递归更新"替代额外训练critic,是一个工程上更轻量、理论上也算优雅的方案。与你关注的duplex agent方向的连接点在于:全双工交互场景本质上也是一种极端的多轮/多轮次决策过程(何时该说话、何时该等待、何时该打断),而"如何把稀疏的整体交互质量反馈拆解到具体的turn-taking决策上"正是duplex agent训练可能会遇到的同构问题——如果未来要用RL微调duplex策略的turn-taking行为,这里的轮级信念传播思路(而非单纯的轨迹级reward)或许有直接的借鉴价值。不过需要注意,这篇论文的"turn"指的是agent-环境交互轮次(如ALFWorld中的一步动作),与duplex agent里"轮次"的语义(对话说话权切换)并不完全等价,迁移时需要重新定义信念状态的观测变量。整体上这是一篇扎实的agentic RL方法论文,但创新点相对聚焦在信用分配机制本身,尚未涉及多智能体或实时交互场景的验证。
Agentic RLCredit AssignmentSelf-DistillationLong-Horizon Agent
来源: arXiv:2608.05987