← 首页|学术|StreamingThinker: Large Language Models Can Think While Reading
StreamingThinker: Large Language Models Can Think While Reading
arXiv ↗
cs.CL 2510.17238

StreamingThinker: Large Language Models Can Think While Reading

EIT-NLP 团队
ICLR 2026 · arXiv 2510.17238 · Oct 2025 (v3 Mar 2026, 代码已放)
💬  边读边想:输入流式到达时按句启动 CoT——流式 CoT 数据构造 + 流式 attention mask/位置编码 + 并行双 KV cache(读与想真并发);性能持平 batch thinking,推理起始等待降 80%、答案时延降 60%+。

🔧 机制三件套

① 句级推理单元的流式 CoT 数据管线;② 流式 attention mask(推理不可见未来输入)+ 独立从零编号的位置编码;③ 并行双 KV cache 把 prefill(读)与 decode(想)解耦并发。

数据管线:<EOS> 句界 → 生成器出每句推理(<EOT> 终止)→ 更大教师模型重构强化顺序对齐 → 双指标过滤(granularity score 细粒度对齐 + sequential consistency score 用 SentenceBERT 度量推理句与输入句相似度)→ token 干预生成深度变体 → Pass@2 失败弃。读完后指令选深度:D1 直答 / D2 全局整合 / D3 全局+反思。

作者点名'简单交错 input/reasoning 句'是伪流式:与预训练格式不符且仍串行执行(想的时候不能读)——真正并发要靠双 cache 只在 cross-attention 合并。附录讨论其与 prefill-decode 分离服务架构的天然亲和。逐句推理的四种操作:理解摘要/消歧重组/逻辑外推/无关内容跳过思考。

📊 结果

Qwen3 家族、数学/逻辑/上下文 QA:性能与 batch thinking 持平,token 等待 −80%、最终答案时延 −60%+。

流式思考的附带收益(作者动机之二):batch 范式下输入越长注意力对早期信息越稀释,靠更长 CoT 或反复自refine补偿——流式推理让注意力与输入顺序对齐,减少这种补偿开销。

局限:任务以最终答案为中心(整条边X边想线的共同局限:不面对因自己动作而变化的世界);深度在读完后由指令指定而非模型自适应;句级单元粒度固定。同组已衍生视觉版+领域综述——跟进 follow-up。

💡 对主线的启示

把回合制 LLM 改造成流式思考者的最完整开源配方(mask+位置编码+并行 cache 三件套,代码已放)——流式 CUA '边观察边想'能力的工程参照。

双指标质量控制(粒度+顺序一致性)解决合成流式 CoT 的对齐问题,比 VST 的过滤更显式,可与 VST 知识图谱管线组合。'伪流式'批评(交错=串行)可借用于批评截图轮询式 CUA。

全覆盖链位置:读=本篇、听=SHANKS、说=STITCH、看=VST、潜=Silent Thought——G3(边动边想)空白。与 AnytimeReasoner 互补:本篇管'什么时候开始想'(与输入对齐),那篇管'想到一半被砍断怎么办'(预算鲁棒)。

🏷 关键词

think-while-readingstreaming CoTstreaming attention maskparallel KV cachereasoning depthQwen3prefill-decodeICLR 2026