🔧 机制
GLM-4-Voice 交错格式(13 text+26 speech)中插入固定 100-token 推理块:Stitch-R 先想后说(首块延迟略增)、Stitch-S 先说后想(零附加延迟)。
预算账目:A100+vLLM 80 tok/s × 2s 播放窗 = 160 token 产能,减去必须的 39 个 text/speech token,剩 121 token 可用于不出声推理。训练数据构造极简:把完整 CoT 切成 100-token 块交错进序列做 SFT,无特殊标注。
延迟对照揭示的原则:TBS(想完再说)延迟最长、Stitch-R 只等一个推理块、Stitch-S 零附加——延迟-质量帕累托由 chunk 调度决定而非推理总量。首个给 SLM 引入 unspoken reasoning 的工作(作者声明)。
📊 结果
五个数学 QA 数据集比无 CoT 基线 +15%;非推理数据集持平(推理块不伤闲聊)。
Stitch-S 在保持与无推理基线完全相同延迟的前提下拿到推理收益——'免费'的推理。局限:固定块长无自适应时机;推理与说话的一致性靠数据切块顺序,无显式机制;单底座;评测域窄。
注意引用出处纪律:'SHANKS+STITCH(听时想+说时想)组合无人做'的声明出自 SHANKS 论文而非本篇(团队卡片陷阱标注)。
💡 对主线的启示
'播放窗=免费算力窗'的账目算法直接移植:把音频播放窗换成预约动作的执行窗,即我方场景版 STITCH。
预算公式(吞吐×窗长−必须 token=可想 token)是 chunk 级解码预算调度的原型——与 DuplexSLA 的 per-chunk 动作 token 预算、duplex-omni-agent 的 chunked decode budget 同族。动作执行期间(拖拽 800ms、页面加载 2s)的解码余量正是 GUI 场景的'播放窗'。
对照阅读:SHANKS(听时想,同团队,chunk 间续接上下文——与 VST 的丢弃式打断对比)、VST(看时想+摊销不等式)、PACE(按行动执行窗口分配推理 token 的 embodied 版)。全覆盖链:读=StreamingThinker、听=SHANKS、说=STITCH、看=VST、潜=Silent Thought——唯独视觉动作通道(G3)空白。