GPT-6让机器人认识万物,具身智能公司如何守住最后壁垒
OpenAI发布的GPT-6 Astra模型凭借单张图片生成可交互仿真环境的能力,打破了通用多模态模型与物理世界的界限。尽管它能识别物品、理解空间关系,但在复杂物理交互方面仍显不足,这为具身智能公司留...
9月3日,OpenAI发布GPT-6 Astra模型后,一场关于通用大模型与具身智能的讨论在科技圈引发热议。这款模型无需专门训练即可从一张包含容器和液体的图片中,识别出物品及其空间关系,并生成一个可交互的数字场景,甚至还原了液体的颜色。
这一突破性进展让业界重新审视通用多模态模型与物理世界的关联。过去,从单张图片或视频重建可交互场景是Real2Sim领域需要专门研究的问题,而Astra的出现表明,通用模型已经具备了初步的物理世界认知能力。然而,当开发者要求Astra模拟两种液体混合后的化学反应时,模型却无法完成,暴露出其在物理因果理解上的局限性。

这种能力边界的变化对具身智能行业产生了深远影响。在过去两年,数字世界的大模型被认为无法理解物理世界,因此需要专门训练一套属于机器人的基座模型。但GPT-6的出现让这一假设面临挑战。模型从互联网图片、视频中学习到的物品外观、用途和操作方式,使其能够识别杯子、抽屉、门把手等常见物品,而无需实际接触这些物体。
“GPT-6已经建立了一本覆盖面极广的‘物理世界图鉴’。”一位行业观察者表示,“但它并不等于真正理解物理世界。”例如,模型可以识别桌面上的杯子并指导机器人抓取,但在夹爪力度、接触点偏移、摩擦力等细节上,仍需要来自真实世界的反馈。
这种差异使得具身智能公司的价值定位发生了转变。过去,机器人能够认出桌上的苹果被视为一项技术突破;而在GPT-6时代,识别苹果本身已不再是核心壁垒。创业公司若继续依赖文本、图片和互联网视频进行预训练,将难以与头部通用多模态模型竞争。
“通用模型可以承担物品识别、任务理解和步骤拆解,具身模型则需要回答动作发生之后,环境会如何变化。”一位具身智能公司创始人指出,“这才是真正的壁垒所在。”
在2026年Inclusion·外滩大会上,多位创业者就这一问题展开了讨论。破壳机器人创始人许华哲表示,虽然GPT-6在语义和空间泛化能力上表现出色,但在复杂物理交互任务上仍有不足。“它能完成简单的抓取动作,但对于筷子这类细小物体的精确操作,以及涉及力觉的任务,仍然无法胜任。”
上海科技大学研究员石野也认为,GPT-6的表现虽然令人惊叹,但从控制机械臂完成简单任务,到真正像人一样理解物理世界,仍有很长的路要走。“它更像是一个强大的系统架构师,能够拆解任务、组织系统和调用工具,但并不等于掌握了稳定执行物理任务的能力。”
自变量机器人创始人王潜则指出,如果通用模型公司进入具身智能领域,它们同样需要采集物理世界数据、建立仿真和评价系统,并处理硬件问题。“本质上,它们只是另一个具身智能公司。”
尽管如此,通用模型的崛起也为具身智能公司带来了新的机遇。大规模预训练依然有效,通过在机器人数据之外加入通用数据,至少可以给具身模型带来能力增益。因此,具身智能公司不应放弃预训练,而应继续建设数据、评价和训练基础设施。
“未来机器人的上层能力与底层技能可能会形成更明确的分工。”苏度科技联合创始人韩铮表示,“通用模型负责理解环境、进行抽象推理和拆解任务,底层模型则专注于抓取、移动、插接等具体操作。”
总的来说,GPT-6的出现标志着通用多模态模型与物理世界的深度融合,但也凸显了复杂物理交互仍是具身智能公司的核心壁垒。行业专家普遍认为,随着技术的不断发展,机器人将逐步实现上层认知与底层技能的明确分工,而具身智能公司需要在这一过程中找到自己的定位。