← 首页|学术|GRAFT: Adaptive DLM-Based Draft Tree Construction with Target-Distilled Edge Scoring
cs.CL · 2608.20375 · 24 Jun 2026

GRAFT: Adaptive DLM-Based Draft Tree Construction with Target-Distilled Edge Scoring

Xuming Ye, Zeming Ma, Runjie Yu, Yuan Liu, Tianle Li, Shuhan Bai, Jian Zhou, Fei Wu
💬 用扩散语言模型(DLM)做投机解码的 draft 生成,天然产不出"父子链"式的路径树——因为 DLM 一次前向就吐出所有未来位置的分布,不是逐词条件生成。GRAFT 用"从目标模型蒸馏出的父子兼容性打分"取代裸概率选边,再用"状态感知的动态预算"替代固定树大小,在几乎不增加开销的前提下把端到端解码速度推到 2.13×–6.36×。

🎯 问题

DLM drafter 与"父条件展开"式树构建不兼容
标准的树形投机解码(tree-based speculative decoding)通过同时验证多条 draft 路径来提高平均接受 token 数,但树的构建方式通常是"父条件展开"(parent-conditioned expansion)——每个子节点 token 都要在其父路径的条件下逐步生成。这套流程和 DFlash 这类扩散语言模型(DLM)drafter 天然冲突:DLM 一次前向传播就直接吐出所有未来位置各自的完整分布,没有"先生成父再生成子"的序列依赖结构。
前驱工作 DDTree 的两个缺口
DDTree 通过把每个未来位置分布中的高概率 token 当作候选节点、在固定节点预算下为相邻位置选边,弥合了这个不兼容问题。但它有两处不足:
1)边选择只看 token 自身概率,不建模父子兼容性,导致原本和目标模型(target model)兼容的 token 可能被接到错误的父节点上;
2)固定预算忽略了"吞吐最优的树大小"会随解码状态(decoding state)变化而波动——不同轮次该用大树还是小树,DDTree 无法自适应。
Speculative DecodingDiffusion LMDDTree

🔬 方法

Target-Distilled Edge Scoring(TDES)
从目标模型(target model)的解码轨迹中蒸馏出"父子偏好",用这份偏好来给候选边打分、挑选真正与目标模型兼容的边,而不是只依赖 drafter 自身输出的 token 概率。这样可以避免"高概率 token 挂在错误父节点上"这一 DDTree 的核心问题。
▶ 技术细节
摘要页未展开 TDES 蒸馏的具体训练目标/损失形式或数据构造方式,这部分细节需要查阅全文。
State-Aware Budget Allocation(SABA)
不再使用固定的每轮树节点预算,而是根据当前解码状态动态设置预算:在"扩树能带来的预期 draft 收益"与"验证这棵树所需的额外代价"之间做权衡,自适应地决定这一轮树该长多大。
▶ 技术细节
摘要页未给出预算分配的具体优化目标或阈值机制,这部分细节需要查阅全文。
背景:投机解码(speculative decoding)用一个小 drafter 模型快速生成候选 token(或候选树),再由大的目标模型一次性并行验证,命中即接受、未命中则回退,从而在不损失生成质量的前提下减少目标模型的串行前向次数。树形版本让 drafter 一次生成多条候选路径,验证阶段可以并行核对更多候选,进一步抬高平均每轮接受的 token 数。

📊 结果

端到端加速比
2.13×–6.36×
相对自回归解码
每轮额外开销
<0.5ms
开销占比
≈1.4%
目标模型验证延迟
论文声称上述结果在多个模型和多个任务上均成立,但摘要页未列出具体的模型名称、数据集或详细的消融实验表格——这些需要查阅全文 PDF/HTML 获取。

💡 为什么值得关注

推理基础设施 × 低延迟解码
GRAFT 的核心贡献不是新模型而是"树构建策略"这一推理时(inference-time)优化:用几乎可忽略的开销(<0.5ms/轮,约为验证延迟的1.4%)换取数倍的解码吞吐提升。对于对延迟极度敏感的场景——比如全双工交互(duplex agent)中"思考层"需要在严格时间片内产出高质量 token——这类不改变模型权重、只优化解码调度的加速技术具有直接的工程价值:它降低的是"思考"本身的延迟下限,而不需要重新训练或牺牲推理质量。
Speculative DecodingDiffusion Language ModelDraft TreeInference InfrastructureLatency
来源:arXiv:2608.20375 摘要页。全文 PDF/HTML 未解析,方法细节与具体实验设置以摘要页公开信息为准。