智象发布具身世界模型HiDream-O1-Embodied,扰动适应榜登顶
在具身智能领域,智象未来(HiDream.ai)于2026年9月7日正式发布了其最新成果——具身世界模型HiDream-O1-Embodied。这一模型在国际领先的具身智能评测平台RoboColise...
在具身智能领域,智象未来(HiDream.ai)于2026年9月7日正式发布了其最新成果——具身世界模型HiDream-O1-Embodied。这一模型在国际领先的具身智能评测平台RoboColiseum上首次参评,并在核心的Robustness(扰动适应)子榜单中以平均分0.692的成绩荣登榜首,展现了其在复杂环境下的卓越性能。
该模型的突破性表现源于智象未来坚持的"原生全模态"技术路线。具体而言,其在语言理解、视觉感知和训练阶段均实现了显著创新:语言理解方面覆盖多元句式与等价指令空间;视觉感知综合多视角信息,即使部分视角失效仍可执行任务;训练阶段主动引入非理想条件,强化模型在不完整信息下的容错能力。数据层面,智象采用"真实基座+生成增强"范式,以高精度动捕数据为底座,借助全模态生成能力进行百倍级样本扩增,使模型在训练中充分接触各种不完美情况。
智象未来CTO姚霆表示,HiDream-O1-Embodied的发布是公司技术战略从模拟世界向真实世界迈进的关键节点。这一成果不仅验证了其全模态技术路线的有效性,也为具身智能在实际应用场景中的落地提供了新的可能性。
在当前具身智能技术路线分化加剧的背景下,智象的这一进展引发了业界广泛关注。清华大学李升波教授课题组近期发布的物理原生世界模型Phi-WM 1.0 ActEffect,以及Generalist、Skild AI等公司推出的基于ICL(上下文学习)路线的机器人模型,共同推动着具身智能技术的快速演进。然而,不同团队对世界模型的理解和实现路径仍存在显著差异,这使得行业尚未形成统一的技术标准。
斯坦福大学教授李飞飞团队提出的Atlas世界模型,强调通过物体的位置、形状、距离和空间关系来理解和模拟3D世界;而图灵奖得主杨立昆团队则专注于稀疏表征在世界模型中的应用,以降低预测器复杂度。这些不同的研究方向表明,具身智能领域的技术探索仍在多条路径并行推进。
尽管技术路线尚未收敛,但智象此次发布的HiDream-O1-Embodied无疑为行业提供了一个重要的参考案例。其在扰动适应方面的优异表现,特别是对光照、材质、相机位置等非理想因素的鲁棒性,为具身智能系统在真实世界中的可靠运行提供了有力支撑。这一成果也印证了业内专家的观点:真正有效的具身智能解决方案,需要深入理解物理世界的底层规律,并将其转化为机器人的泛化能力。