← 首页|学术|Optimizing Anytime Reasoning via Budget Relative Policy Optimization (AnytimeReasoner)
Optimizing Anytime Reasoning via Budget Relative Policy Optimization (AnytimeReasoner)
arXiv ↗
cs.LG / cs.CL 2505.13438

Optimizing Anytime Reasoning via Budget Relative Policy Optimization (AnytimeReasoner)

Sea AI Lab + NUS
NeurIPS 2025 poster · arXiv 2505.13438 · May 2025
💬  把推理链训成'随时可砍断':RL 时从先验采样思考预算并截断、每个截断点强制总结出可验证答案——稀疏 outcome 奖励变逐预算档稠密奖励;思考/总结策略解耦 + BRPO 方差缩减,全预算档一致优于 GRPO。

🔧 机制

采样预算 b~p_B、截断思考链(插省略号+</think>)、每档强制总结答案并验证——等价于最大化分数-预算曲线下面积(支撑集 m≤8 档)。

三组件:① 预算采样(对打断鲁棒+激励更快到达正确答案);② 思考/总结策略解耦优化(总结策略恒用均匀预算分布训练——以往'超长即负样本'的做法在在线服务不现实);③ BRPO——用'同链更早预算档得分(当前进度 V1)'与'组内平均回报(V2)'插值作 baseline,超越 GRPO 组内基线的方差缩减。

anytime 语义直承 Dean & Boddy / Zilberstein:随时可打断、给当前最优解、资源越多越好。与 budget-aware(预算预先给定)的关键区别:支持增量加预算——已花的思考可复用续想。稠密奖励的信用分配副产品:自动定位哪段思考贡献了首个正确答案(正确前档位奖励低、正确后累积回报低)。

📊 结果

数学推理:全部预算档、各种先验分布下一致优于 GRPO;三组件各自独立加进 GRPO 都显著提升;只用最大预算(不采样)也仍胜 GRPO。

部署动机(原文):服务过载时提前截断已达足够精度的请求、资源富余时留长思考;用户想控预算但最优预算未知(Gemini 2.5 thinkingBudget 场景)。高质量总结对最终与 anytime 性能都关键——解耦训练总结策略的原因。

⚠️ 录用状态:团队卡片记录 NeurIPS 2025 poster(OpenReview kMGc0yvM61),但线 10 陷阱 #18 标注未亲核——正式引用前再查一次。局限:纯文本数学域、预算以 token 计(墙钟换算问题同 RealtimeGym)、截断总结质量依赖总结策略容量。

💡 对主线的启示

推理侧微调最可搬的方法:把'token 预算先验'换成'环境速度档/决策窗分布'即得实时版训练目标——每个时间档都要能交出可执行动作。

三条映射:① 额定速度曲线=分数-预算曲线的墙钟版;② BRPO 的 V1 baseline 在我们场景=更慢档位下同一策略的表现(跨速度档方差缩减有现成形式);③ 截断鲁棒+增量续想是 G5(推理链续接)的半个解——但只在文本域,无感知流无动作。

负结果背书(团队调研):以外部时间压力(非题目难度)为条件的学习型 when-to-think 零篇——G2 空白仍在,本方法是最近的起点。互补成环:AnytimeReasoner(训练目标)+ Budget-Aware Anytime Reasoning 的 Anytime Index(度量)+ RealtimeGym 的 budget forcing(评测协议)。对照:VST 的优势广播是另一种稠密化路径(广播 vs 逐档验证)。

🏷 关键词

anytime reasoningbudget samplingBRPOverifiable dense rewardstruncated thinkingdecoupled policiesGRPOvariance reductionNeurIPS 2025Sea AI Lab