🎯 问题
现代 VLA 不可能在一个控制周期内完成推理(π0 3B 光 KV prefill 46ms vs Δt=20ms)——异步是必须的,但 chunk 切换会跳模式造成分布外动力学。
action chunking 是模仿学习的事实标准,但有两个代价:牺牲对外部刺激的反应性、chunk 交界处不连续(相邻 chunk 可能从学到的多模态分布中跳到不同'策略')。好的实时系统要产生一致连续的控制信号、吸收最新观察、又不扰动环境动力学——这句问题陈述几乎逐字适用于流式 CUA。
形式化:d:=⌊δ/Δt⌋ 为推理延迟(控制步数)。真实数字:π0 3B 在 RTX 4090 上 KV prefill 46ms(目标 50Hz);远程推理网络延迟理想有线 13ms;OpenVLA 7B 专门优化后在 A100 上仍 321ms。d 由过去延迟 buffer 滚动预报,自适应而非超参——'延迟作为一等输入'的范本。
🔧 机制
inpainting 三件:硬冻结前 d 步(必然执行);重叠区软掩码(权重 1→0 指数衰减);guidance 权重截断 β 保证少步去噪下稳定。
基于 ΠGDM 的免训练 inpainting:每个去噪步给学到的速度场加梯度引导项,使生成与'被掩码的目标'(旧 chunk)一致。软掩码是关键增量:只用前 d 步做硬约束时引导信号太弱(d 小时尤甚),新 chunk 仍会切换策略;把全部 H−s 步重叠区纳入、按未来不确定性指数衰减加权,才拿到完整的跨 chunk 连续性。
系统实现:InferenceLoop 后台线程持续生成(永远有动作可用);执行窗 s=max(d, s_min) 逐 chunk 自适应;guidance 是 vector-Jacobian 积(反向自动微分)——这也是主要计算开销来源。局限(作者自述):开销显著;只适用 diffusion/flow 策略;真实实验未覆盖腿足运动。
📊 结果
真机 π0.5 六任务:+200ms 注入延迟 RTC 零退化(统计显著最优),同步线性退化,temporal ensembling 振荡到触发保护停机;无延迟时同样动作快 20%。
仿真(Kinetix 12 动态随机环境、每点 2048 trials):RTC 对延迟最鲁棒,胜 BID(后者采 64 chunk 算力更多);TE 在 d=0 就差——多模态分布下对有效动作取平均得到无效动作;软掩码在小 d 时显著优于硬掩码;执行窗越短 RTC 越好(真正吃到闭环修正红利)。
真机吞吐指标 = 任务完成度/episode 时长——同时反映速度与质量,是'额定速度'报告格式的候选。去掉推理暂停后 RTC 仍比同步快:收益不只来自不停等,还来自动作连续性本身。点火柴任务扛 300ms+ 延迟(>30% 预测窗)。
💡 对主线的启示
前缀冻结≅预约档同构:已承诺动作不可改、未来动作按不确定性衰减可修——动作接口时序条件的连续版本。
与训练期版(Training-Time Action Conditioning, 2512.05964)合读构成'同一补偿的 inference-time vs training-time 解'最干净对照:RTC 在分布外做 inpainting 修补,训练期版把延迟采样进训练分布、高延迟下反超。引用数字:+200ms 零退化、300ms+、快 20%。
⚠️ 引用注意:'多时间尺度推理/按需暂停想深是未解'的说法团队卡片标注出自 PI outlook,但当前 arXiv v2 正文 Discussion 无此句——引用前核对出处(可能在 PI 博客或 v1)。TE 失败机理(多模态分布下平均无效)是对任何'平滑多个候选动作'方案的通用警告。对照阅读:HiRT(快慢分层)、OneTwoVLA(事件触发推理)、VLASH(条件于预测未来态)。