← 首页|学术|ω-0:面向并发人形移动操作的潜在预测世界动作模型
cs.RO · 2608.06375 · 提交于 2026年8月6日

ω-0:面向人形机器人并发移动操作的潜在预测世界动作模型
ω-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation

Zhe Li, Zhenzhe Zhang, Yangyang Wei 等 — 北京大学(Shanghang Zhang 团队)
💬 面向人形机器人"边走边操作"这一并发loco-manipulation任务的世界-动作模型:不重建未来视频,而是学习轻量的未来观测嵌入作为预测目标,把潜在视觉预见与基于扩散的全身动作生成耦合在一起。配套发布40+小时真实家庭场景数据集ω-HOME,在11个真实家庭任务上稳定优于模仿学习、VLA、人形和WAM等基线。

🎯 问题

现有人形策略把移动和操作割裂开,世界-动作模型也不够"全身"
人形机器人做家务任务时常常需要"并发loco-manipulation":机器人必须同时移动、调整姿态、维持平衡并操作物体,作为一个统一的协调行为完成。但现有的人形策略通常把移动(locomotion)和操作(manipulation)拆解成两个独立模块分别处理,而近期的世界-动作模型(world-action model)要么只关注手臂(arm-centric),要么以视频为中心(video-centered),都没有真正针对"全身协调、边走边做"这种复合行为建模。

🔬 方法

潜在视觉预见 + 扩散式全身动作生成
ω-0 给定语言指令、当前视觉观测和机器人本体感知状态,直接预测与控制器兼容的全身动作潜变量用于真实机器人执行。与重建未来视频画面不同,ω-0 学习的是紧凑的未来观测嵌入作为一个轻量级的预测目标,将这种潜在视觉预见能力与基于扩散模型的全身动作生成耦合在一起。模型支持第一人称RGB、第三人称RGB和第三人称深度三种输入模态,并利用基于控制器的仿真回放(simulation replay),把人类/公开视觉运动先验数据"接地"转化为机器人可执行的动作潜变量。
作者同时采集了 ω-HOME 数据集:40+小时真实世界家庭人形数据,包含同步多视角观测、全身SMPL人体动作、机器人状态和动作潜变量。

📊 结果

11个真实家庭任务上单模型稳定跑赢多类基线
真实世界实验覆盖11个家庭任务,结果显示单个ω-0模型能够产出平滑的"边移动边操作"行为,并且一致优于代表性的模仿学习方法、VLA、专门的人形策略以及其他世界-动作模型(WAM)基线。摘要未给出具体数值指标。

💡 我的看法

这是一篇人形机器人全身控制的世界模型论文,与你关注的duplex agent交互架构没有直接技术关联,这里给一个独立的评估。方法上比较有意思的设计选择是"预测未来观测的潜在嵌入而非重建未来视频"——这本质上是在世界模型里做了一次表征学习层面的降维,避免了像素级视频生成带来的巨大计算开销和噪声敏感性,转而把"预见能力"压缩成一个更紧凑、更贴近下游动作生成需求的表示,这个思路与近年视频世界模型领域"从像素预测转向潜空间预测"的大趋势是一致的(比如Dreamer系列、V-JEPA一脉的思想)。另一个值得关注的贡献是用仿真回放把人类动作先验转化为机器人可执行动作潜变量,这提供了一条不完全依赖真实机器人遥操作采集数据的路径,对于数据稀缺的人形机器人领域有实际价值。局限在于摘要没有给出任何量化的成功率或提升幅度数字,"稳定优于基线"的说法缺乏具体强度支撑,且并发loco-manipulation这类任务的评测本身就存在环境多样性不足、任务定义主观的问题,这些都需要看正文的实验设置细节才能判断结果的可信度。
Humanoid RobotWorld ModelLoco-ManipulationDiffusion PolicyEmbodied AI
来源: arXiv:2608.06375