通用世界模型五级路线图发布,生数科技详解迈向具身智能的关键路径

8月19日,在北京举行的2026世界机器人大会(WRC)分论坛"具身智能大模型的进化之路:从技术分级到产业落地"上,生数科技创始人兼首席科学家朱军发表主旨演讲,发布了团队关于通用世界模型的最新研究成果...

人工智能

8月19日,在北京举行的2026世界机器人大会(WRC)分论坛"具身智能大模型的进化之路:从技术分级到产业落地"上,生数科技创始人兼首席科学家朱军发表主旨演讲,发布了团队关于通用世界模型的最新研究成果,并详细阐述了其五级发展路线。

朱军表示,通用世界模型的核心目标是构建一个能够理解世界、预测未来并采取行动的通用基座模型,而非服务于特定任务或场景的专用模型。他指出,这一模型需要具备三项核心能力:理解世界(看懂环境、判断状态)、预测未来(预判动作结果)、采取行动(影响环境并用真实反馈修正认知),三者形成一个闭环反馈系统。

"通用世界模型不是单一的生成器、模拟器或策略模型,也不是这些能力的简单线性串联,而是三种能力耦合在一起的有机整体。"朱军强调,行动不仅是模型的输出,还会改变环境、产生新信息,进而进入下一轮理解、预测和决策循环。

在数据层面,朱军提出了一个多层金字塔结构:最底层是海量网络视频数据,向上依次为领域视频、第一视角人类视频、带动作记录的人类示范数据,最顶层则是真实机器人交互数据。越靠近底层的数据规模越大、覆盖面越广;越靠近顶层的数据虽然更稀缺、成本更高,但能更直接地建立任务、动作与物理结果之间的联系。

架构方面,生数科技采用了MoT(Mixture-of-Transformers)架构,为不同模态配置专属参数,并通过共享注意力机制实现跨模态信息交互。基于此架构开发的世界动作模型Motubrain,将环境理解、状态预测与动作生成统一建模,打破了传统分模块方案的能力割裂,同时提升了异构数据利用效率和跨任务迁移能力。

通用世界模型的五个层级分别为:L1世界生成(World Generation)、L2与世界交互(Interactive World)、L3在世界中行动(Actionable World)、L4自主世界智能体(Autonomous World Agent)、L5世界组织者(World Orchestrator)。目前,生数科技的研发实践已覆盖前三个层级。

朱军指出,尽管L1到L3已有相对具体的技术实践,但在视频生成质量、可控性、时空一致性等方面仍有待提高;将世界动作模型应用于更复杂开放的真实环境时,稳定性、泛化能力和执行效率也需要进一步优化。

对于更高层级的发展,朱军指出了六项关键挑战:建立联合评测体系、学习真实物理规律、形成持久记忆、实现在线学习与自我进化、满足高效闭环部署需求、确保安全性与可控性。

"当理解、预测与行动真正形成闭环,世界模型将不再只是生成内容的模型,或执行任务的机器人策略,而会成为连接数字世界与物理世界、迈向通用具身智能的重要基础。"朱军总结道。

图片

该研究的发布引发了业界广泛关注。上海交通大学助理教授穆尧认为,端到端学习型世界模型有望在部分场景逼近甚至超过传统物理引擎;地平线研究院副院长苏治中表示,世界模型将渗透策略、数据与评测三个层面,成为云端基础设施;莫刻机器人联合创始人池晓威则判断,世界模型最终会收敛为独立的基础模型系统。

专家们普遍认为,未来两到三年,大部分普通难度任务将被通用机器人解决,行业将迎来类似GPT-3、ChatGPT的关键时刻;五到十年后,机器人将进入本体与模型协同自进化的阶段。