🔧 机制
三处最小改动:per-token flow timestep;前缀=真值+τ=1.0、后缀正常去噪、loss 只落后缀;训练时随机采 d(真机 Unif[0,10],50Hz 最高 200ms)。
学的是 p(A_{t+d:H} | o_t, A_{t:t+d})——延迟 d 通过 per-token timestep 模式显式告知模型。τ=1.0 的巧思:flow matching 插值在 τ=1 恰好等于干净动作,零新机制表达'此 token 是已知真值'。推理时每去噪步 jnp.where 把前缀钉回已承诺动作。接口与推理期 RTC 完全一致,drop-in 替换。
架构改动仅 adaLN-zero 的 scale/shift/gate 从整块共享改 per-token,可学习参数量不变;官方'a few additional lines of code'属实(附完整 Python)。仿真延迟采样用 {0..4} 指数递减权重——'高延迟需要的监督更少'是反直觉实践笔记。真机从未做前缀条件预训练的底座 π0.6 直接微调即可(8,000 步、batch 512)。
📊 结果
仿真 d≥2 起训练期版反超推理期版且差距随延迟拉大;真机 π0.6(espresso+装箱)性能速度持平、端到端 108ms vs 135ms。
反超的解释:前缀越长,inpainting 要'越用力'才能出一致后缀,且依赖模型 Jacobian 线性化——分布外修补;训练期版直接在分布内。省掉的 27ms 正是每去噪步的 vector-Jacobian 开销。训练算力对齐(推理期版训 32 epoch,训练期版从第 24 epoch 继续微调 8 epoch)。
作者自述局限:只支持'硬'前缀(丢掉软掩码对前缀外重叠动作的柔性利用);训练延迟分布要按部署延迟仔细选——分布错配风险换推理零开销。同期工作:SmolVLA(异步但没解决不连续)、A2C2(修正头)、VLASH(条件单个未来动作 vs 本文完整前缀)。preprint 未同行评审,数字低置信,生态内自证。
💡 对主线的启示
微调配方三条映射的直接来源:①部署时序条件编码进训练样本;②前缀冻结≅预约档'不可更改';③兑现比例作早期信号。
训练 vs 推理取舍教训:推理期方法零训练成本但高延迟崩(分布外),训练期方法要求预知部署延迟分布——调速阶梯恰好能给'部署延迟分布'提供测量依据,评测与微调在此闭环。与 RTC 合读构成同一补偿的两种解法的最干净对照。
对我们微调臂的具体映射(团队讨论中待拍板):per-token τ 模式=把'延迟多大'作为训练信号的范本,可推广为'动作接口时序条件'(预约档/兑现窗)的编码方案;真值前缀+τ=1=已承诺动作的训练期表达;检验微调是否生效的最便宜探针=承诺动作兑现比例的变化。对照:Figure Helix(训练期延迟标定时间偏移的另一实例)、VLASH(条件于预测执行时刻未来态)。