ω-0: 人形机器人全身世界动作模型

1413
0
2026-08-10 10:20:00
40
13
56
15
很高兴分享我们的最新工作 ω-0: A Latent Predictive World Action Model for Concurrent Humanoid Loco-Manipulation。   Humanoid loco-manipulation 不应被简单地分解为彼此独立的 locomotion 与 manipulation,即“先移动再操作”或“固定站立进行操作”。对于真实家庭任务,人形机器人需要协调双腿、躯干、双臂与双手,在持续移动的同时完成操作。   基于这一目标,我们提出 ω-0,一个面向真实家庭场景的 whole-body loco-manipulation World Action Model (WAM)。   在方法上,ω-0 借鉴 V-JEPA 的 latent prediction 思路,并进一步将未来视觉动态建模与全身动作生成进行耦合。模型联合预测 future visual latents 与 future action conditions,并通过 DiT 生成可由 whole-body controller 执行的 action latents。通过这种设计,模型不仅学习任务和场景将如何演化,同时能够直接生成与未来动态相一致的全身协同动作。   所有真实机器人实验均由同一个统一模型完成,而非针对不同任务分别训练独立策略。ω-0 在 Unitree G1 上完成了 11 个真实家庭 loco-manipulation 任务,包括擦桌子、拖地、捡垃圾、整理水果、洗衣机取放衣物以及冰箱取物等。   与此同时,我们构建了 ω-HOME,一个包含 40+ 小时真实家庭交互数据的多模态 whole-body loco-manipulation 数据集。数据同步包含 egocentric / exocentric RGB、depth、robot states、whole-body SMPL motions 以及 action latents,为真实世界 humanoid whole-body learning 提供了系统化的数据基础。   📄 Paper: https://arxiv.org/pdf/2608.06375v1 🌐 Project Page: https://gentlefress.github.io/OMEGA-0_page/
客服
顶部
赛事库 课堂 2021拜年纪