← 首页|学术|STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models
arXiv ↗
cs.CL / eess.AS 2507.15375

STITCH: Simultaneous Thinking and Talking with Chunked Reasoning for Spoken Language Models

Chiang et al. (台大 + 微软,与 SHANKS 同团队)
ICLR 2026 · arXiv 2507.15375 · Jul 2025
💬  边说边想:语音块播 2s 而生成它只要 0.5s(80 tok/s),播放窗剩余算力生成最多 121 个不出声推理 token——固定 100-token 推理块与 text/speech 块交替,推理成本全藏进播放期;数学 +15%、Stitch-S 零附加延迟。

🔧 机制

GLM-4-Voice 交错格式(13 text+26 speech)中插入固定 100-token 推理块:Stitch-R 先想后说(首块延迟略增)、Stitch-S 先说后想(零附加延迟)。

预算账目:A100+vLLM 80 tok/s × 2s 播放窗 = 160 token 产能,减去必须的 39 个 text/speech token,剩 121 token 可用于不出声推理。训练数据构造极简:把完整 CoT 切成 100-token 块交错进序列做 SFT,无特殊标注。

延迟对照揭示的原则:TBS(想完再说)延迟最长、Stitch-R 只等一个推理块、Stitch-S 零附加——延迟-质量帕累托由 chunk 调度决定而非推理总量。首个给 SLM 引入 unspoken reasoning 的工作(作者声明)。

📊 结果

五个数学 QA 数据集比无 CoT 基线 +15%;非推理数据集持平(推理块不伤闲聊)。

Stitch-S 在保持与无推理基线完全相同延迟的前提下拿到推理收益——'免费'的推理。局限:固定块长无自适应时机;推理与说话的一致性靠数据切块顺序,无显式机制;单底座;评测域窄。

注意引用出处纪律:'SHANKS+STITCH(听时想+说时想)组合无人做'的声明出自 SHANKS 论文而非本篇(团队卡片陷阱标注)。

💡 对主线的启示

'播放窗=免费算力窗'的账目算法直接移植:把音频播放窗换成预约动作的执行窗,即我方场景版 STITCH。

预算公式(吞吐×窗长−必须 token=可想 token)是 chunk 级解码预算调度的原型——与 DuplexSLA 的 per-chunk 动作 token 预算、duplex-omni-agent 的 chunked decode budget 同族。动作执行期间(拖拽 800ms、页面加载 2s)的解码余量正是 GUI 场景的'播放窗'。

对照阅读:SHANKS(听时想,同团队,chunk 间续接上下文——与 VST 的丢弃式打断对比)、VST(看时想+摊销不等式)、PACE(按行动执行窗口分配推理 token 的 embodied 版)。全覆盖链:读=StreamingThinker、听=SHANKS、说=STITCH、看=VST、潜=Silent Thought——唯独视觉动作通道(G3)空白。

🏷 关键词

think-while-speakingunspoken reasoningchunked reasoningplayback windowspoken language modelsGLM-4-Voicelatency-free CoTICLR 2026