← 首页|学术|DLCoT: Deconstructing Long Chain-of-Thought
cs.CL cs.LG · 2503.16385 · Mar 2025

DLCoT: Deconstructing Long Chain-of-Thought

Yijia Luo, Yulin Song, Xingyao Zhang, Jiaheng Liu — Alibaba Group / NYU
CoT Distillation Agent Training Long Reasoning Data Quality
核心结论:长 CoT 蒸馏的质量瓶颈不是"错误路径的污染",而是"正确主干内的多样性是否充分"。删掉冗余可以提效,但删掉错误路径在难题上反而伤害性能——因为那些"看起来错的"探索也在向学生模型传递有用的搜索策略。

🎯 问题

长 CoT 蒸馏的传统假设为什么成立不住
将 QwQ、R1 等教师模型的长 CoT 蒸馏到学生模型时,标准做法是过滤掉"有错误"的 CoT,只用正确的轨迹训练。这个假设来自 SFT 的干净标注直觉——但长 CoT 的结构远比单步 SFT 复杂:一条 CoT 可以包含多个探索方向,其中一些失败、一些成功,最终得到正确答案。
关键观察:把"包含错误步骤"的 CoT 都过滤掉,实际上在过滤掉大量包含多样探索的 CoT。而这些多样探索对学生模型的泛化能力至关重要——尤其是面对训练分布外的新题目时。

🔬 方法:DLCoT 五步管道

Step 1:宏观结构解析
将整条 CoT 切分为四个宏观段:问题重述(Problem Restatement)→ 方法探索(Approach Exploration)→ 验证(Verification)→ 总结(Summary)。这个分割是规则驱动的,基于标记 token("嗯", "等等", "所以"等)。
Step 2:方法与验证的精细解析
在"方法探索"段内,用 LLM 进行自由分段,将整个探索部分切割成若干原子推理单元(atomic reasoning units)。每个单元代表一次独立的解题尝试或一条推理路线。
Step 3:冗余分析与方法分类
对所有原子推理单元进行语义聚类,去除近似重复。然后将每个候选方法分类为三类:Correct(正确且完整)、Incomplete(方向正确但未完成)、Erroneous(错误路径)。核心发现在于如何处理 Erroneous 类。
Step 4:优化整合
裁剪冗余探索(同一方法的多个近似重复),但保留多样化的正确路径。对于 Erroneous 路径,在简单任务(GSM8K)上可以删除,但在难题(AIME)上保留——甚至保留少量错误路径比删干净更好。
Step 5:连贯性重建
对重组后的 CoT 进行最小编辑重写,确保段落间语义流畅,消除拼接痕迹。

💡 核心洞察:三种 CoT 拓扑与"主干"概念

长 CoT 的三种结构模式
主干(Trunk)定义:从所有探索路径中找到最短的完整正确推理路径。DLCoT 的核心论点是:主干内的方法多样性比主干本身的正确性纯度更重要。保留丰富的探索(即使包含错误方向)让学生模型学会"如何在不确定中搜索",而不只是"如何在确定情境中执行已知步骤"。
反直觉结论:在 AIME 难度级别,将 Erroneous 路径全部删除后,性能下降明显。说明学生模型需要从"错误尝试"中学习某种隐含的搜索策略,这部分信息在纯正确轨迹中不存在。

📊 主要结果

AIME2024
53.3%
Qwen2.5-14B + R1
vs 32B 基线
+6.6%
更小模型,更强结果
Token 节省
≥5%
裁冗余,不裁性能
模型 / 设置AIME2024MATH500GSM8K
Qwen2.5-14B + DLCoT (R1 teacher)53.3%91.4%
Qwen2.5-14B + DLCoT (QwQ teacher)40.0%87.7%
Qwen2.5-32B-QwQ-Distill (baseline)46.7%91.9%
Qwen2.5-14B + 仅保留正确路径↓ 明显下降小幅下降接近
Qwen2.5-14B + 删除所有 Erroneous↓ AIME 下降基本持平持平
▶ 消融实验细节
难度梯度非常清晰:删除 Erroneous 路径的负面影响随任务难度增大。GSM8K(简单)几乎不受影响;MATH500(中等)小幅下降;AIME2024(极难)下降最明显。这直接支持"困难任务需要从错误探索中学习搜索策略"的假设。

R1 蒸馏的 14B 模型超越 QwQ 蒸馏的 32B 基线,说明 CoT 质量(结构化多样性)比教师模型本身的参数量更关键。

🔗 对 Agentic RL 训练的启示

轨迹数据质量的反直觉原则
DLCoT 的发现可以直接迁移到 agentic RL 的轨迹质量判断上:不应该只用"成功完成任务"的轨迹训练 agent。包含合理探索(哪怕中途走过弯路)的轨迹,可能比线性成功轨迹对模型的泛化更有价值——因为 agent 在新环境中首先需要的是"知道如何系统地探索",而不是"知道在这个场景下执行什么"。
与 ASTER 对照:ASTER 发现 agentic RL 的冷启动需要"行为多样、工具调用密集"的 SFT 数据,而不是"结果正确"的数据。两篇论文从不同角度指向同一个原则:训练信号的多样性 > 训练信号的纯净度
arXiv:2503.16385 · Alibaba Group / New York University · March 2025 · 精读:2026-07-14