← 首页|学术|Latent Action as Intention Enables Efficient Future Imagination for World Action Models
cs.RO · 2608.24882 · 25 Aug 2026

Latent Action as Intention Enables Efficient Future Imagination for World Action Models

Xiang Li, Yupeng Zheng, Songen Gu et al.
💬 世界-动作模型(WAM)靠"预测未来画面"提升机器人控制效果,但生成未来观测在推理时太慢;LAWA 用紧凑的潜在动作表示"意图",跳过生成未来视频这一步,同时保住了未来想象带来的泛化增益。

🎯 问题

效率与泛化的两难:要不要生成未来观测
World Action Models 通过建模观测如何随动作演化来提升机器人控制能力,但在测试时生成未来观测会带来显著的推理延迟。直接砍掉这部分(Fast-WAM)虽然快,但作者的对照实验显示,Fast-WAM 的泛化能力明显弱于保留"未来感知"能力的方案,尤其是在机器人示范数据稀缺、以及分布外场景下差距更明显。

🔬 方法

LAWA:以潜在动作作为未来意图的紧凑表征
LAWA 引入紧凑的潜在动作(latent action)作为未来意图的操作性表征,使模型能在推理时高效地"想象未来"而无需真正生成未来观测画面。具体而言,一个经过无动作(action-free)预训练增强的离散分词器(tokenizer)产生以操作为中心的码本(codebook)目标;LAWA 联合去噪一个锚定在这些目标上的连续潜在状态与可执行的动作片段,并在推理阶段省去未来视频生成分支。

📊 结果

在 RoboCasa 上,LAWA 在少样本与全数据两种设定下分别取得 65.6%80.8% 的平均成功率,比对照的 Fast-WAM 基线分别提升 9.64.5 个百分点;同时保持了与联合建模的 Joint-WAM 变体相当的性能水平,但推理延迟降低了 42.9%。在 LIBERO-Plus 上表现出有竞争力的零样本鲁棒性,在真实世界任务上也有优势。
World Action Model潜在动作机器人操作推理效率泛化