世界动作模型ω-0发布,重塑人形机器人居家作业模式,成功率达81.8%

近日,一个由南洋理工大学、北京大学、香港科技大学(广州)和智源研究院共同研发的世界动作模型ω-0正式发布。这一突破性成果标志着人形机器人在家庭场景中的应用迈出了重要一步,有望重塑居家作业模式。 核心创...

人工智能

近日,一个由南洋理工大学、北京大学、香港科技大学(广州)和智源研究院共同研发的世界动作模型ω-0正式发布。这一突破性成果标志着人形机器人在家庭场景中的应用迈出了重要一步,有望重塑居家作业模式。

核心创新:从“先走后做”到“边走边做” 传统机器人系统通常采用“分步走”的策略,即先移动到目标位置再进行操作。然而,在真实家庭环境中,这种模式难以应对复杂的动态任务。例如,擦拭大尺寸桌面时,机械臂伸展到极限后需要移动身体才能继续;拖地时,拖把的运动直接影响身体平衡,双腿必须随手臂动作不断调整重心。这些看似简单的家务,对机器人而言却是巨大的挑战。

图片

针对这些问题,ω-0模型摒弃了传统的视频到动作逆向转换方法,转而构建了一个统一的查询表征(Query-based Representation)。在这一架构中,未来视觉特征提供了任务进度和场景演变的宏观指引,而动作分支则直接生成可供底层控制器执行的全身动作潜在指令。这种设计使得机器人能够在移动过程中同时完成操作任务,显著提升了任务执行的流畅性和效率。

三阶段递进式训练架构 为了让人形机器人更好地适配真实家庭场景的复杂需求,研究团队设计了三阶段递进式训练架构。第一阶段是全身动作VLM专属预训练,通过Whole-Body FAST tokenizer将机器人连续、高维度的全身运动轨迹转换为离散action tokens,并基于Qwen3-VL-2B-Instruct微调构建专属的全身动作VLM模型。第二阶段是人机动作隐变量预训练,借鉴V-JEPA思路,将视觉、语言和机器人状态信息融合,通过Video query预测未来视觉特征,并利用扩散模型DiT直接生成全身动作潜变量。第三阶段是在真实居家场景下的精细化微调,引入实时分块策略(RTC)提升动作连续性,使模型能够在真实环境中完成行走、躯干调整、手臂操作等全身协同任务。

图片

多模态数据集ω-HOME 为了加速真实家庭环境下全身世界动作模型的学习,研究团队还开源了一个名为ω-HOME的数据集。该数据集包含40.3小时的真实环境数据、4827条任务轨迹和24项任务,覆盖了物体取回、桌面清洁、家电使用、收纳整理等典型家庭任务。每条轨迹均同步采集了语言指令、第一视角与第三视角、本体状态、全身运动轨迹等数据,为模型训练提供了丰富的监督信号。

性能表现 在11项真实家庭移动操作任务上的测评结果显示,ω-0模型展现出卓越的性能。其中,Ego第一视角任务成功率达79.1%,Omni全场景模式成功率高达81.8%,全面超越了π-0.5、EgoVLA、GR00T-N1.7、ψ-0等主流行业基线模型。这些结果表明,ω-0模型不仅能够处理单一任务,还能在复杂多变的家庭环境中实现全身协同操作。

图片

行业影响与未来展望 ω-0模型的成功发布,为人形机器人技术的发展指明了一个新的方向。它强调将机器人的全身作为一个整体来思考,而不是将腿和手当作两个各自为政的部门。当机器人学会在移动中操作、在操作中调整姿态,才有了从“实验室演示”走向“生活化服务”的可能。

然而,尽管取得了显著进展,距离一个能真正融入家庭、长期自主运行的机器人出现,还有很长的路要走。未来的研究需要进一步提升机器人的环境适应能力、自主决策能力和长期稳定性,以满足更广泛的家庭需求。

总的来说,ω-0模型的推出不仅是技术上的突破,更是人形机器人迈向实用化的重要里程碑。随着相关研究的深入和技术的进步,我们有理由相信,不久的将来,这些智能机器人将成为家庭生活中不可或缺的一部分。