🔧 机制
帧积累成 clip(视觉 token 达容量 L 切界)→ 每 clip 触发流式思考 z^k~p(z|c^k,m^{k-1}) → FIFO 文本长期记忆;query 到达用记忆+最新 clip 直接出答案。
双记忆:短期原生视觉 buffer + 长期文本语义记忆(固定预算推理无限流)。联合分布因子分解为'Direct Answer 项 × 流式思考连乘项'。底座 Qwen2.5-VL 3B/7B/32B、2fps、视觉编码器全程冻结。打断语义:被 query 或新 step 打断时退回最新完成的记忆态——丢弃进行中思考,非续接(G5 缺口的实证)。
VST-SFT:流式思考建模为多轮对话(clip/thought 交错),流式 attention mask 强制时间因果(思考只见当前 buffer+历史文本),loss 只落思考与最终回答,每样本 128s 时限。VST-RL:verl+vLLM+FSDP 多轮自探索,奖励只看最终答案对错,优势广播到轨迹全部生成 token(含 query 前所有思考)——'事前想'由'事后答对'获得信号;DAPO 式 clip、group 8、rollout batch 256。
🧬 数据合成
视频实体-关系建知识图谱 → 采样多跳证据链 → Gemini 生成流式 QA + 接地流式 CoT → 自动过滤:100K 高质量流式推理样本。
设计目的:强制多证据推理与对视频流的持续注意,且生成的思考与视频上下文严格对齐(时间因果不越界)。这是'给流式模型造思考标注'的可复制流程。
对 duplex-omni-actor 微调臂的移植方案:把'视频实体关系'换成'环境状态变迁+动作机会',证据链换成'状态-机会-动作'链,即可生成流式 CUA 的思考标注——团队卡片将其列为微调思考标注的直接参照。
📊 结果
StreamingBench 79.5% / OVO-Bench 59.3% 开源 SOTA;比 Video-R1 响应快 15.7× 且 VideoHolmes +5.4%;离线长视频/推理榜保持竞争力。
摊销数字(可引):流式思考每 16–32 秒异步触发、均值 7.0 秒、P99 11.2 秒——短于最小触发间隔,开销全部摊进播放,query 后零附加延迟。消融:SFT 主要提升后向记忆(+9.2%),RL 主要提升前向预测(+12.7%);两阶段合并最优。
最大思考次数消融:Backward 任务随思考次数持续涨到 16 步(更多思考=更精确的记忆),Real-Time/Forward 在 ≥4 步饱和(过多记忆细节引入冗余)——'思考预算的边际收益按任务类型分化'。测试时每步(含思考与最终回答)cap 8,192 视频 token、最大思考次数 4。
💡 对主线的启示
摊销不等式(生成 7.0s < 间隔 16–32s)是摊销合法性的显式判据——调速阶梯正好扫这个不等式反转的时刻;优势广播技巧可直接搬进 RL 配方。
四点:① 合成流式 CoT 管线是造 CUA 思考标注的最近参照;② 优势广播解决'事前思考无直接监督';③ 打断=丢弃非续接(G5 空白实证);④ 纯理解任务、不面对因自己动作而变的世界(G3 仍空)。
clip 切界由 token 容量驱动而非语义/紧迫度——与 OneTwoVLA 的事件触发相比是'定容量摊销'vs'事件触发'两种时机策略,我们的微调可以把两者作为对照配方。局限:思考质量无过程信号(只有 outcome 奖励);评测受限于既有流式榜的伪流式问题。对照:StreamingThinker(读)、SHANKS(听)、STITCH(说)、The Silent Thought(潜空间)——全覆盖链唯独缺视觉动作通道。