🔧 机制三件套
① 句级推理单元的流式 CoT 数据管线;② 流式 attention mask(推理不可见未来输入)+ 独立从零编号的位置编码;③ 并行双 KV cache 把 prefill(读)与 decode(想)解耦并发。
数据管线:<EOS> 句界 → 生成器出每句推理(<EOT> 终止)→ 更大教师模型重构强化顺序对齐 → 双指标过滤(granularity score 细粒度对齐 + sequential consistency score 用 SentenceBERT 度量推理句与输入句相似度)→ token 干预生成深度变体 → Pass@2 失败弃。读完后指令选深度:D1 直答 / D2 全局整合 / D3 全局+反思。
作者点名'简单交错 input/reasoning 句'是伪流式:与预训练格式不符且仍串行执行(想的时候不能读)——真正并发要靠双 cache 只在 cross-attention 合并。附录讨论其与 prefill-decode 分离服务架构的天然亲和。逐句推理的四种操作:理解摘要/消歧重组/逻辑外推/无关内容跳过思考。
📊 结果
Qwen3 家族、数学/逻辑/上下文 QA:性能与 batch thinking 持平,token 等待 −80%、最终答案时延 −60%+。
流式思考的附带收益(作者动机之二):batch 范式下输入越长注意力对早期信息越稀释,靠更长 CoT 或反复自refine补偿——流式推理让注意力与输入顺序对齐,减少这种补偿开销。
局限:任务以最终答案为中心(整条边X边想线的共同局限:不面对因自己动作而变化的世界);深度在读完后由指令指定而非模型自适应;句级单元粒度固定。同组已衍生视觉版+领域综述——跟进 follow-up。
💡 对主线的启示
把回合制 LLM 改造成流式思考者的最完整开源配方(mask+位置编码+并行 cache 三件套,代码已放)——流式 CUA '边观察边想'能力的工程参照。
双指标质量控制(粒度+顺序一致性)解决合成流式 CoT 的对齐问题,比 VST 的过滤更显式,可与 VST 知识图谱管线组合。'伪流式'批评(交错=串行)可借用于批评截图轮询式 CUA。
全覆盖链位置:读=本篇、听=SHANKS、说=STITCH、看=VST、潜=Silent Thought——G3(边动边想)空白。与 AnytimeReasoner 互补:本篇管'什么时候开始想'(与输入对齐),那篇管'想到一半被砍断怎么办'(预算鲁棒)。