← 首页|学术|精读:Ring-Zero — 万亿参数规模的 Zero RL 涌现推理
cs.CL · 2607.12395 · v1: 14 Jul 2026, v2: 16 Jul 2026
Ring-Zero: Scaling Zero RL to a Trillion Parameters for Emergent Reasoning
16位作者(含 Yuliang Zhan)
Zero RL
万亿参数
CISPO
涌现推理
Ring 系列
核心主张:把 zero RL(从预训练模型直接做 RL,不经推理向 SFT)第一次扩展到万亿参数规模是可行的,但需要一整套配套方案——四阶段训练流程(推理激发→自蒸馏→持续优化 RL→自适应推理深度)、专门设计的 clipped 重要性采样策略梯度(非标准 PPO-clip)、训练-推理 ratio 校正、以及针对超大模型的混合精度与并行优化。规模带来的不只是分数提升,还有 5 种此前小模型上不明显的涌现认知行为(拟人化表达、结构化格式、并行推理、上下文焦虑、自我验证)。
🎯 问题定义:naive zero RL 在万亿规模会遇到什么
为什么"zero RL"本身不是新概念,但规模化是新问题
DeepSeek-R1-Zero 等工作已经证明:跳过推理向 SFT,直接对预训练/基座模型做 RL 也能涌现出长链推理能力。但这些验证都停留在数十亿到百亿参数级别。本文的问题是——当模型规模推到万亿参数时,naive 地照搬同一套 zero RL 流程会不会失效?
论文指出三类会在万亿规模被放大的问题:(1) 预训练模型的原始输出分布过于发散,直接上 RL 采样效率极低;(2) 训练与推理系统之间的数值/精度不一致,在小模型上误差可忽略,在万亿参数长序列 rollout 中会累积成显著的 ratio 偏差,直接影响策略梯度的正确性;(3) 单一固定的推理深度无法适应难度分布跨度极大的任务集——简单题目上过度推理浪费算力,难题目上推理深度又不够。
解法总览
针对这三个问题,Ring-Zero 分别用四阶段训练流程解决(1),用训练-推理 ratio 校正机制解决(2),用 tier 化的自适应推理深度解决(3)。三者组合,使得万亿参数规模的 zero RL 训练可以稳定收敛并涌现出强推理能力,而非在早期就因采样效率或数值误差而崩溃。
🔧 方法:四阶段训练流程 + 核心算法
阶段 1:推理激发(Reasoning Elicitation)
从预训练基座模型出发,先用少量精心设计的提示/数据把模型的潜在推理能力"引出来",而非让 RL 从完全随机的输出分布开始探索。这一步的目标不是教会新能力,而是把已经隐含在预训练权重里的推理模式变成可采样、可被 RL 进一步强化的行为。
阶段 2:自蒸馏(Self-Distillation)
模型对自身在阶段 1 中产生的高质量推理轨迹进行蒸馏,把分散、偶发的好推理路径固化为更稳定、更常出现的默认行为模式,为后续大规模 RL 提供更集中的初始策略分布,从而提升 RL 阶段的采样效率。
阶段 3:持续优化 RL(Sustained Optimization RL)
这是主训练阶段,使用大规模在线 RL 持续优化模型的推理能力。核心算法选择是clipped 重要性采样策略梯度,与标准 PPO-clip 的关键区别在于:只在触发 clip 时对该 token 的梯度做 stop-gradient 处理,而不是像标准 PPO-clip 那样直接把整个更新裁掉。这样可以保留更多有效梯度信号,避免在长序列大模型场景下梯度过度稀疏。
同时引入训练-推理 ratio 校正:用 Megatron 训练引擎计算出的 logits 作为重要性采样比值的分子,替代直接使用推理引擎(如 vLLM 等)的 logits。原因是训练引擎与推理引擎在数值精度、算子实现上存在细微差异,这种差异在万亿参数、长 rollout 序列下会被放大成不可忽视的 off-policy 偏差,用训练引擎自身的 logits 做校正可以消除这一系统性误差来源。
正则化上使用 KL 惩罚项,系数 β=10⁻⁴,散度形式为 K3 estimator(对偶散度的低方差无偏估计)。损失聚合上支持 token-level 与 sample-level 两种粒度切换,用于平衡长短回答之间的梯度权重分配。
阶段 4:自适应推理深度(Adaptive Reasoning Depth)
训练模型根据任务难度自动选择推理"档位"——论文设计了 Low / Medium / High 三档系统提示词,分别对应不同的目标推理长度和搜索深度。模型学会依据问题的表面难度线索自主判断该用哪一档,从而避免简单题目上的过度思考(overthinking)与难题目上的推理不足。
🏗️ 基础设施优化
混合精度:BF16 主体 + FP32 关键路径
模型主体计算使用 BF16 以控制显存与算力开销,但 softmax 计算和 LM-head 输出层使用 FP32。这两处是数值误差最敏感、也最容易在长序列/大词表场景下放大误差的环节,用 FP32 兜底可以在几乎不增加整体成本的情况下大幅提升数值稳定性——这也是训练-推理 ratio 校正能够生效的前提之一。
MLA 全对全上下文并行
针对 Multi-head Latent Attention(MLA)架构设计了专门的 all-to-all 通信模式做上下文并行,使得长上下文场景下的注意力计算可以在多设备间高效切分,这是支撑万亿参数模型 + 长 CoT rollout 的关键工程手段。
Lightning Attention AllGather 优化
对 Lightning Attention 机制中的 AllGather 通信模式做了专门优化,降低分布式训练中的通信开销,这是万亿参数规模下让 RL rollout 吞吐量维持在可接受水平的必要优化之一。
📈 训练动态:Discovery vs Sharpening 两阶段
阶段划分依据:pass@1 与 pass@1024 的分离走势
论文观察到训练过程中存在两个性质不同的阶段:
Discovery(发现)阶段:pass@1024(在1024次采样中至少一次命中的概率,衡量模型"是否具备解题能力的上限")持续上升,而 pass@1(单次采样命中率)提升相对缓慢。这表明模型在这一阶段主要是在探索、发现新的正确解法路径,尚未把这些路径变成稳定的默认行为。
Sharpening(收敛/锐化)阶段:pass@1024 趋于平台(不再显著上升),但 pass@1 持续快速攀升。这表明 RL 在这一阶段的主要作用是把已经"发现"过的正确路径变成模型更大概率会选择的默认输出——即把探索到的能力"锐化"为稳定可靠的表现。
这一区分对理解 zero RL 的作用机制很重要:RL 早期扩大的是能力边界(pass@1024),后期起作用的是把边界内的能力转化为稳定输出(pass@1)。两阶段对训练超参(如探索温度、KL 系数)的最优设置可能是不同的。
✨ 5 种涌现认知行为
1. 拟人化表达(Anthropomorphism)
模型在推理过程中会使用第一人称、带情绪色彩的表述(如表达"犹豫"、"确信"等语气),而非纯粹中性的逻辑陈述。这类表达在小模型上较少观察到,在万亿参数规模的 RL 训练后变得更加常见。
2. 结构化格式(Structured Format)
模型自发地在长推理链中采用更清晰的结构化组织方式(如分步骤、分条列举、使用标记区分不同子任务),而非一整段连续的自由文本推理。这种格式化倾向并非被显式训练目标要求,而是在 RL 优化过程中自然浮现的。
3. 并行推理(Parallel Reasoning)
模型在单条推理链内部会同时展开多条并行的解题思路(例如尝试多种方法并交叉验证),而不是严格线性的单一思路推进,展现出类似"同时保持多个假设"的推理模式。
4. 上下文焦虑(Context Anxiety)
模型表现出对上下文长度/预算的显式关注,例如在推理中提及"篇幅有限"、主动压缩表述或提前规划推理步骤以避免超出上下文窗口——这是一种对自身计算资源约束的隐式建模,在小模型上不明显。
5. 自我验证(Self-Verification)
模型在得出候选答案后主动进行独立的复核/验算步骤,而不依赖外部反馈信号触发——这是与阶段 4 自适应推理深度机制相互增强的行为:模型学会了在什么情况下值得多花一步做自检。
📐 CoT 质量评估框架
论文提出一个三维度框架来量化评估思维链(CoT)质量,而不只是看最终答案对错:
| 维度 | 含义 |
| 可理解性(Comprehensibility) | 推理链本身是否清晰、人类可读、逻辑连贯 |
| 可复现性(Reproducibility) | 沿着同样的推理链是否能稳定复现出正确结论,而非偶然蒙对 |
| 效率(Efficiency) | 达到正确结论所消耗的推理步数/token 是否经济,是否存在无意义的重复或绕路 |
用这一框架量化对比不同训练阶段的模型,结果显示随着训练推进(尤其进入 Sharpening 阶段后),三个维度均有提升——说明 RL 不仅让答案更对,也让推理过程本身变得更清晰、更稳定、更节省。
📊 基准结果
论文在 7 个数学竞赛类基准上,对训练流程的 7 个阶段(从基座模型到最终版本)逐一评测,展示了每个阶段带来的增量提升。核心结论:
- 阶段 1(推理激发)相对基座模型即带来显著跃升,验证了"引出而非从零学习"的假设
- 阶段 2(自蒸馏)进一步稳定并小幅提升表现,为阶段 3 的大规模 RL 提供更好的起点
- 阶段 3(持续优化 RL)是最大的单阶段增益来源,且训练曲线体现出前述 Discovery→Sharpening 的两阶段特征
- 阶段 4(自适应推理深度)在不显著增加平均推理成本的前提下带来了额外的准确率提升,主要收益来自于难题目上更充分的推理分配
最终版本在全部 7 个数学竞赛基准上均达到或逼近同期前沿模型水平,验证了万亿参数规模 zero RL 流程的有效性。
🔬 消融研究
1. RL 算法对比(GRPO / DAPO / CISPO / GSPO)。论文对比了多种当前主流的策略优化算法变体,验证了自身采用的 clipped 重要性采样策略梯度方案在万亿参数规模下相较标准 GRPO/DAPO 等方法的优势——尤其是在长序列梯度稀疏问题上的缓解效果。
2. KL 消融。验证了 K3 散度 + β=10⁻⁴ 的选择是在训练稳定性与探索能力之间的合理折中——β 过大过度约束探索,过小则容易在大模型上出现策略漂移。
3. Ratio 校正方法消融。对比"用训练引擎 logits 校正"与"直接用推理引擎 logits"两种方案,证明前者显著降低了 off-policy 偏差带来的训练不稳定性,是万亿参数规模下的必要设计而非锦上添花。
4. Format-reward 消融。验证格式奖励对训练稳定性和输出可读性的贡献,但格式奖励设计本身容易引入 reward hacking 风险,论文对此的讨论篇幅有限。
5. Length-inertia 消融。探讨了输出长度的"惯性"效应(模型倾向于维持与训练分布相近的输出长度)及其对推理深度自适应机制的影响。
6. 超参消融。覆盖学习率、batch size 等常规超参的敏感性分析,用于支撑最终配置选择,但具体数值细节需查阅原文附录确认完整性。
⚠️ 局限性与定位
论文自述的局限性
- 自然难度分布失配:训练数据的自然难度分布与目标评测基准的难度分布之间存在差异,可能导致某些难度区间上的表现被高估或低估。
- 模型容量天花板:即便扩展到万亿参数,某些推理任务仍然受限于模型自身的容量上限,RL 无法凭空创造预训练阶段完全未编码的知识/能力。
- 64k 上下文硬件限制:受限于当前硬件条件,训练与评测的上下文窗口被限制在 64k token,更长上下文场景下的表现尚未验证。
- 预训练知识天花板:RL 能够激发和锐化已隐含在预训练权重中的推理模式,但无法突破预训练阶段本身知识覆盖的边界。
与既有 zero RL 工作的定位关系
论文将自身定位为 DeepSeek-R1(-Zero)、DAPO、VAPO、SimpleRL-Zoo、Open-Reasoner-Zero 等既有 zero RL 工作在参数规模轴上的延伸——这些工作验证了 zero RL 范式本身的有效性,但都停留在数十亿至百亿参数级别;Ring-Zero 的贡献是证明并解决了将这一范式扩展到万亿参数所需的一整套工程与算法问题。基础设施方面参考并扩展了 Megatron-LM、ZeRO、MegaScale、veRL、OpenRLHF 等既有训练框架的设计。
🏁 总体判断 & 可借鉴点
总体判断
这篇论文的核心贡献不是提出全新的 RL 算法范式,而是系统性地解决了"把已验证的 zero RL 范式扩展到万亿参数"这一工程与算法难题——训练-推理 ratio 校正、混合精度关键路径设计、四阶段流程分解,都是针对大规模场景的具体问题给出具体方案,而非空泛的"我们把模型做大了"。Discovery/Sharpening 两阶段动态的刻画以及 5 种涌现行为的记录,为理解"规模如何改变 RL 训练的作用机制"提供了有价值的经验证据。
工程严谨度高规模化 zero RL 里程碑涌现行为值得关注
可借鉴点 1:训练-推理数值不一致是规模化 RL 的隐藏地雷
在中小模型 RL 训练里常被忽略的训练引擎与推理引擎数值差异,在大模型长序列场景下会被放大成实质性的 off-policy 偏差。对任何做大规模在线 RL 的团队,"用训练引擎 logits 校正 ratio"是一个通用可迁移的稳定性手段,而不只是 Ring-Zero 的特例做法。
可借鉴点 2:pass@1 vs pass@1024 的分离监控,是诊断 RL 训练所处阶段的低成本信号
很多 RL 训练只跟踪单一的 pass@1 曲线。同时监控 pass@1024(能力上限)和 pass@1(默认输出稳定性),可以判断当前训练处于"探索新能力"还是"巩固已知能力"阶段,从而针对性调整探索系数、KL 强度等超参——这对 agent RL 训练(如工具调用、多步规划)同样适用。
可借鉴点 3:自适应推理深度(tier 化系统提示)是控制推理成本的实用手段
用 Low/Medium/High 档位系统提示让模型自主选择推理深度,是一种成本低、易实现的方案,可直接迁移到任何需要平衡"简单任务快速响应"与"难任务深度推理"的场景,不需要训练独立的路由模型。
可借鉴点 4:涌现行为记录本身是一种有价值的模型行为分析方法论
与其只报告 benchmark 分数,系统性记录规模变化带来的定性行为变化(拟人化、并行推理、上下文焦虑等)为理解"RL + 规模"的复合效应提供了额外的诊断维度,值得在其他大规模 RL 工作中借鉴这种记录习惯。
值得追踪的开放问题
- Discovery→Sharpening 的转换点能否被提前预测,从而动态调整训练超参而非事后观察?
- "上下文焦虑"这类涌现行为是否会在更长上下文(超过 64k)场景下演变成新的失效模式(如过早截断推理)?
- 训练-推理 ratio 校正方案是否可以标准化为通用组件,被其他大规模 RL 框架(veRL、OpenRLHF)直接复用?
- 自适应推理深度机制与 agent 场景下"何时调用工具/何时终止推理"的决策问题是否可以用类似的 tier 化思路统一处理?
来源:arXiv:2607.12395v2 · 提交 2026-07-14,修订 2026-07-16 · 16位作者 · CC BY 4.0