← 首页|学术|SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models
arXiv ↗
cs.CL / eess.AS 2510.06917

SHANKS: Simultaneous Hearing and Thinking for Spoken Language Models

Chiang et al. (台大 + 微软,与 STITCH 同团队)
ACL 2026 long · arXiv 2510.06917 · Oct 2025
💬  边听边想:用户语音按 4s chunk 流入、听第 i 块时对前 i−1 块做不出声 CoT(预算 ~320 token 超时强制闭合、推理跨块保留续接);打断有效率 +37.1%、56.9% 工具调用在用户话音未落前完成。

🔧 机制

听 S_i 时想 R_{i−1};S_i 说完后停 R_{i−1}、入上下文、开始 R_i。推理块 <think>...</think> 包裹,超预算强制补闭合,之前所有推理保留续接。

预算 = t_chunk × n_tps(4s × 80 tok/s ≈ 320 token,7B 单卡 A100)。SFT 训出(交错语音/思考序列、标准 LM loss),非 prompt 方案;底座 Qwen2.5-Omni thinker-talker,只把 response token 送 talker 合成语音;工具场景序列过长用 LoRA。

推理续接是与 VST 的关键差异:VST 被打断丢弃进行中思考退回最新完成态,SHANKS 跨块保留全部推理——G5(推理链续接)在'听'通道有部分解。作者 future work:更聪明的分块降低听-想延迟(固定 4s 是妥协)。

📊 结果

数学打断场景:打断次数 +71%、打断有效率 +37.1%(vs 不想就打断);工具场景:56.9% API 调用在用户说话期间完成,最终响应延迟显著降。

对照发现:GPT-4o 等闭源模型无法在用户说话时打断。与 Stream RAG(同期差一周)划界:那边只决定何时发检索查询、无显式静默 CoT;SHANKS 是更广的 thinking-while-listening 范式。

关键声明(原文核验、出处在本篇):'the two methods can be combined: an SLM can think when listening and speaking. We believe this will be the future of SLM, and we leave this as a promising future direction.'——SHANKS+STITCH 组合无人做的声明在 SHANKS 不在 STITCH(团队引用纪律)。

💡 对主线的启示

提前调工具=提前行动的原型:输入还在流入时开始不可见的准备动作——动作侧'预约/投机执行'在语音域的对应物。

三点:① 56.9% 提前完成与 Speculative Interaction Agents 的'只读可投机'判据互引;② 推理续接正例(对比 VST 丢弃式);③ 组合声明是'边动边想'(G3)的引用锚点——我们是该组合在动作通道的推广。

局限:固定 4s chunk、数学打断为构造性任务、32k 上下文限制、未见开源代码(08-16 快照,复现前重查)。对照:STITCH(说时想)、Chronological Thinking(严格因果零附加时延的听时想)、DuplexSLA(动作与说话同轴的模型侧)。

🏷 关键词

think-while-listeningincremental reasoningearly tool callsinterruptionspeech chunksQwen2.5-Omniunspoken CoTACL 2026SHANKS