世界模型崛起,机器人AGI的“身体”与“大脑”如何被重构
随着阿里云、酷哇科技等企业在世界模型领域的持续投入,机器人AGI正从理论走向实践。本文梳理了世界模型的核心定义、技术演进路径以及当前商业化落地案例,揭示物理AI如何通过压缩建模实现对复杂环境的理解与决...
在人工智能领域,2026年被视为"机器人AGI元年"。阿里CEO吴泳铭在云栖大会提出,未来机器将承担99.9%的思考工作,但"代表性产品尚未出现"。这一判断背后,是世界模型技术正在成为构建物理AI的关键基石。
世界模型:压缩建模物理世界的“大脑"
上海AI实验室对世界模型给出了明确的定义:它是在有限计算资源下,对物理世界状态转移过程的压缩建模。这种压缩不是简单的数据生成,而是信息论意义上的提炼。一个典型的世界模型需要具备三大特性:全模态感知(视觉、听觉、触觉等)、多维异步性(不同维度数据采样频率差异)和局域性(POMDP框架下的局部观察)。
值得注意的是,上海AI实验室强调"数据决定上限"——任何智能系统在物理世界的泛化能力,最终由训练数据的物理多样性决定。目前唯一能规模化提供这种多样性的,是开放互联网视频数据。例如,NVIDIA的Cosmos 3模型就尝试用统一的混合专家Transformer架构,同时处理语言、图像、视频、音频和动作五种模态。
从“看到就做”到“先想象再行动"
传统视觉语言模型(VLA)遵循"看到什么就做什么"的原则,而新一代世界-动作模型(WAM)则引入了"先预测后行动"的机制。智元机器人发布的GE-Act 2.0就是首个原生世界-动作模型,它从随机初始化开始,在具身数据上进行端到端训练,不针对特定任务微调。该模型仅用24个token(DINOv3的十六分之一)就能表示一帧256×384的画面,并在RTX 5090上实现104毫秒的动作生成。
最令人瞩目的是其验证的"机器人Scaling定律":当训练数据从300小时扩展到3万小时(100倍),机器人在陌生场景的零样本任务完成数量从39项提升至76项,包括折叠毛巾、嵌套纸杯等复杂动作。
数据倒置金字塔:从互联网视频到任务数据
世界模型的 Scaling 前提是高质量的数据。当前主流方法采用"倒置金字塔工作流":先用数十亿量级的互联网视频解锁隐含的物理先验,再逐层过滤、合成、提纯为任务对齐的真实世界数据。这种策略避免了专有机器人数据在多样性上的不足。
智元与上海创智学院联合发布的τ0-WM模型,就是在约27,300小时异构语料上预训练(含17,800小时真机遥操作、6,500小时UMI、3,000小时第一人称人类视频),仅5B参数规模就实现了"动作生成"、"视频预测"、"任务评估"的统一。推理时,它会采样多个候选动作,用动作条件视频模拟器"预演"未来,再选择最有前景的动作执行。
具身AGI的分级与商业化落地
当前具身AGI的发展仍处于L1-L2阶段,距离真正的类人认知还有很长距离。南洋理工的分级体系显示,所有现有系统仅能达到单任务(L1)或组合任务(L2)水平。最难的L5级全功能机器人,需要解决自我意识、终身学习等根本性问题。
在商业化方面,酷哇科技(Coowa)是较早将世界模型应用于实际场景的企业。该公司基于长期运营环卫、末端配送等机器人积累的50PB真实世界数据,推出了Coowa WAM 2.0通用世界模型底座。其双层智能体架构包含Urban VLM(城市视觉语言模型)和CooWAIM(交互式世界-动作模型),分别负责慢思考规划和快思考执行。
未来展望:数据多样性决定能力上限
物理AI的发展路径与大语言模型(LLM)高度相似:通过数据规模的指数级增长来提升能力。但物理数据面临特有的挑战:动作标签稀缺、采集成本高昂。谁能有效获取并利用足够多样性的物理数据,谁就能掌握物理AI的入场券。
网络安全领域已率先实现垂直ASI(专用超级智能),攻防双方均采用博弈论AI,人类角色退居监督者。这表明,当AI在特定领域达到超越人类的能力时,其应用模式会发生根本性转变。
总的来说,世界模型正在重构机器人AGI的"身体"与"大脑"。随着数据规模的持续扩大和技术路线的不断收敛,物理AI将在更多真实场景中展现其价值。