Atlas用3D重建开路,世界模型迈向可测量新阶段

2026年,AI世界模型迎来突破性进展。World Labs发布的Atlas模型通过空间上下文理解,仅需少量照片即可生成高精度3D场景,将传统依赖密集拍摄的3D重建方式转变为消费级操作。这一技术革新不...

人工智能

在人工智能领域,2026年成为世界模型从学术概念走向产业落地的关键节点。随着谷歌、英伟达等科技巨头纷纷布局,国内企业如Manifold AI也推出自研产品,整个赛道呈现出加速发展的态势。然而,在众多玩家中,World Labs推出的Atlas模型凭借其独特的技术路径,为行业开辟了新的发展方向。

Atlas的核心创新在于对空间关系的重新理解。与传统的视频生成模型不同,Atlas能够将普通照片转化为可供计算机直接解析的几何数据。这种转变使得机器人可以直接进入由模型构建的数字空间进行操作和训练,而不仅仅是观看静态画面。例如,当用户输入几张办公桌的照片时,Atlas不仅能还原出完整的三维办公室场景,还能根据后续输入逐步完善细节,直至形成一个可用于仿真测试的完整环境。

这项技术的关键机制在于引入了"空间上下文"的概念。每一张送入模型的照片都被固定在一个三维空间的具体坐标上,相机的姿态和深度信息也随之被带入模型。这意味着模型处理的不再是孤立的图像,而是一张带有坐标的世界草图。通过这种方式,Atlas实现了从二维像素阵列到三维空间坐标的跨越,极大地提升了3D场景构建的效率和精度。

文章配图

以斯坦福大学主方庭为例,Atlas仅需2到25张站在地面随手拍摄的游客照片,就能生成从高空俯瞰的连续飞行画面。这与传统3D重建方法形成了鲜明对比:后者通常需要围绕目标转几十圈,拍摄数百张照片才能拼合出相对完整的模型。Atlas的出现,使得3D内容创作的门槛被大幅拉低,无需专业设备,也无需密集采集,海量旧照片、旧影像都有机会转化为可用的3D资产。

值得注意的是,尽管Atlas已经在几何层面实现了对空间上下文的理解,但其团队的长远目标是让模型最终理解物理规律。目前,Atlas主要关注于几何重建,而物理世界的复杂性(如物体间的相互作用、动态变化等)仍然是亟待攻克的难关。不过,这一初步成果已经为机器人领域带来了革命性的变化。通过构建可交互、可推演的"世界模拟器",Atlas使得机器人可以在AI生成的模拟环境中进行海量试错与策略训练,从而快速积累经验并迁移到真实世界。

文章配图

与此同时,阿里巴巴旗下的高德地图也推出了全球首个3D原生城市世界模型ABot-Earth 0.7。该模型采用3D原生技术路径,能够在单一模型中完成从星球到城市、再到街景地标的全尺寸AI连续生成。与聚焦小尺寸场景或游戏画面生成的3D模型不同,ABot-Earth 0.7能够在单一模型中保持路网、街区和建筑群的整体关系,并进一步还原单体建筑的几何轮廓、立面层次和材质纹理。这一技术进步不仅提升了城市探索的在场感,也为预测、模拟与真实场景中的决策提供了支持。

总的来说,Atlas和ABot-Earth 0.7的相继发布,标志着AI世界模型正在从理论研究向实际应用迈进。它们不仅降低了3D内容生产的门槛,更为机器人训练提供了低成本、高效率的虚拟环境,推动了具身智能的发展。未来,随着技术的不断成熟,我们有理由相信,这些世界模型将在更多领域发挥重要作用。