← 首页|学术|ADRS:自蒸馏奖励塑形构造稠密Token级信用信号
cs.LG / cs.AI · 2608.03223 · 2026年8月4日

ADRS:自蒸馏奖励塑形,用特权技能重打分构造稠密Token级信用信号 · Agentic Reinforcement Learning with Self-Distilled Reward Shaping

Ranxu Zhang, Guinan Chen, Chenshaodong, Jinghao Lin, Xiaozhou Xu, Sunzhe, Yanyong Zhang, Chao Wang
💬 用同一个冻结的行为策略快照,在"有/无特权技能条件"两种情况下分别对已采样的轨迹token重新打分,二者之差就是一个不需要额外标注、推理时也不依赖技能文本的稠密token级信用信号。把这个信号校准、门控后注入GRPO/GiGPO的优势计算,在ALFWorld、WebShop、多跳QA等长程多轮agent任务上持续超过纯轨迹级奖励基线。

🎯 问题

多轮LLM agent任务(如ALFWorld 50轮的家务操作、WebShop的多步网页导航购物)通常只有轨迹终点的稀疏奖励(成功/失败),策略优化时很难判断轨迹中间哪些具体决策token真正"值得"被强化——这就是经典的信用分配(credit assignment)问题。已有工作尝试引入额外的稠密奖励信号(如技能标注、教师模型打分),但往往面临两个矛盾:一是教师打分的原始输出(如log概率)在不同训练步之间存在偏移/尺度漂移,直接使用会引入位置偏差;二是教师的"自信程度"未必等于"有用程度",如果不加甄别地信任教师信号,反而可能引入噪声甚至误导训练。此外,很多方法在推理阶段仍需要额外的技能/知识输入,增加了部署成本。

🔬 方法

特权技能条件重打分(Self-Distillation 核心)
用一个冻结的行为策略快照正常采样出完整轨迹(rollout阶段完全不接触任何技能文本,保持"推理时技能无关")。轨迹固定之后,用一个确定性的检索器取出与当前任务匹配的程序性技能文本,再让同一个冻结快照对已采样的token序列重新打两次分:一次是普通上下文下的log概率,一次是技能文本前置后的log概率。两者的差值就隔离出了"特权信息(技能)对同一批token的边际影响"——这也是"自蒸馏"名称的由来:教师和学生是同一个模型,只是上下文条件不同。
三个模块:校准 → 门控 → 融合
模块一·分数校准:原始教师log概率差在不同训练步之间偏移/尺度不一致,ADRS对每一步内做去均值、除以局部标准差,得到一个每步内求和为零的、有符号的标准化分数,消除位置偏差同时保留token间的相对偏好。
模块二·可靠性门控(Teacher Value Advantage, TVA):在同一个分组内(GRPO下是轨迹级,GiGPO下是步骤级)比较"高置信度"与"低置信度"两类样本对应的实际回报,用sigmoid门控量化"教师置信度是否真的与实际回报正相关"——只有当置信度确实能预测好结果时,门控值才会显著偏离中性,否则自动收敛为不介入。这一步把"教师说得自信"和"教师说得对"两件事解耦开。
模块三·信用融合:校准并门控后的分数先加到环境基础奖励上(在优势计算之前),再走标准的GRPO/GiGPO轨迹级归一化,并额外叠加一个独立白化的token级项,两者合并为一个优势值送入标准的clipped PPO式actor损失——即"教师引导先变成奖励,再变成策略信用",而不是作为独立辅助损失强行拼接。

📊 结果

在ALFWorld(50轮具身家务)、WebShop(15轮网页导购)、以及包含7个数据集的多跳搜索QA(4轮工具调用)三类长程多轮任务上,覆盖Qwen2.5-3B/7B-Instruct与Qwen3-1.7B,与GRPO、GiGPO、OPSD、Skill-SD、RLSD、SDAR等基线对比:
ALFWorld 成功率(3B)
94.5%
Search macro均分
45.0%
WebShop 成功率
76.6%
分别比最强基线高出约10.1、0.4、2.5–8.6个百分点;这一优势在3B/7B/1.7B多个模型尺度上都保持(ALFWorld提升7.8–10.1点)。在300步的长训练中优势持续或扩大,ALFWorld峰值可达97.7%、收尾维持在96.1%。数据效率测试显示ADRS仅用60%训练数据即可超过全量数据训练的GRPO;在ALFWorld六类未见过的任务中有五类展现出良好泛化。Token级诊断还发现,随训练推进,特权信号会逐渐向动作/物体类token集中,而非停留在通用风格类token上——说明学到的信用分配确实在向"任务相关的关键决策点"聚焦。

💡 我的看法

这是"用训练时特权信息弥补稀疏奖励"这条路线的又一个扎实实例,和此前见过的一些工作(用特权观测/标注做reward shaping)思路一脉相承,但ADRS的巧妙之处在于把"特权信息"限定为同一冻结策略在有/无技能条件下的重打分差值,而不是引入外部裁判模型或人工标注——这让整个流程在训练侧几乎零额外部署成本,且推理时策略完全不依赖技能文本,工程上很干净。对duplex/实时agent场景的启发是:多轮长程任务的信用分配问题本质上和实时交互中"何时打断/何时继续深思"的决策粒度问题是同构的——都需要把稀疏的最终反馈拆解到细粒度的中间决策点上。TVA门控这种"区分置信度与有用性"的思路,也可以类比到实时系统中"模型自信不代表决策时机对"的场景,值得关注它是否能迁移到更细粒度(如token/时间片级)的在线信用分配问题上。局限在于:方法仍依赖一个"确定性技能检索器"来提供特权条件,其质量和覆盖范围会直接影响重打分信号的可靠性,论文未充分讨论技能库质量退化时的鲁棒性。
来源: arXiv:2608.03223