李飞飞Atlas模型,具身智能新范式开启3D重建与机器人训练革命
AI领军人物李飞飞创办的World Labs推出新一代世界模型Atlas,该模型能仅凭少量手机照片实现高保真3D重建,并构建可交互的虚拟环境。这不仅降低了3D内容创作门槛,还为机器人提供低成本、高效率...
在人工智能领域,一个世纪前路德维希·维特根斯坦提出的"世界即所发生的一切",如今正被AI领军人物之一李飞飞及其团队重新诠释。近日,由李飞飞创办的World Labs发布了新一代世界模型Atlas,这款全球首个能同时处理文字、图片、视频和3D信息的多模态模型,正在为具身智能领域打开全新大门。
传统3D重建技术长期依赖密集拍摄,需要围绕场景进行多角度、高覆盖率的图像采集才能拼合出完整模型。这种方式对设备、时间和人力要求极高,导致3D内容生产难以规模化。而Atlas通过大模型的强大先验知识与生成能力,仅需少量普通手机拍摄的图像,就能实现高保真3D重建。这意味着海量旧照片、旧影像都有机会转化为可用的3D资产,沉睡的数据潜力被重新激活。
更令人瞩目的是,Atlas的应用已超越传统AI生成模型的服务范畴。它构建了一个可交互、可推演的"世界模拟器",将AI生成能力拓展至机器人领域,即Real-to-Sim。这一创新让生成结果不再局限于静态画面,而是能够被进入、被操作、被验证的动态环境。在机器人领域,这意味着机器人可以在AI生成的模拟环境中进行海量试错与策略训练,通过"想象"预测不同动作可能带来的后果,在虚拟世界中快速积累经验,再迁移到真实世界。这直击机器人真实世界训练数据匮乏、采集成本高昂的核心瓶颈,为具身智能提供了一条低成本、高效率、可扩展的训练路径。
从技术细节来看,Atlas采用了全新的"空间上下文"机制。每一张送进模型的图片都会被锁定在三维空间里的具体坐标上,相机的姿态和深度信息也随同图像一起被带入模型。这种设计使得用户可以像坐进导演椅一样调度镜头,轻松实现复杂的相机运动效果。例如,官方demo中展示了用三到五台普通手机拍摄同一瞬间,模型就能冻结时间、把镜头绕进牛奶溅起的那一刻,其效果与《黑客帝国》中的子弹时间镜头相媲美。
然而,尽管Atlas在几何层面的表现令人惊叹,但其物理理解能力仍有待提升。World Labs明确表示,目前Atlas主要实现了几何层面的"空间上下文"理解,而真正的物理规律理解仍是团队的长远目标。几何回答"东西在哪、长什么样、换个角度还是不是原来的形状";物理则是回答"推它一下会怎么动、会不会倒、捏多重会碎"。两者虽密切相关,但并非一回事。
Atlas的发布不仅推动了3D重建技术的革新,更为具身智能的发展提供了新的可能性。随着这项技术的不断成熟,我们有望看到更多机器人在虚拟环境中快速成长,并最终走向现实应用。这不仅是AI技术的一次重大突破,更是人类迈向更智能未来的重要一步。