谷歌三模型驱动机器人升级,通用具身智能实现多机协同
在人工智能技术快速发展的背景下,谷歌近期发布了一套全新的机器人专用多模态AI系统——Gemini Robotics 2。这套系统由三个定位互补的核心模型组成,旨在打造具备通用具身智能的机器人解决方案,...
在人工智能技术快速发展的背景下,谷歌近期发布了一套全新的机器人专用多模态AI系统——Gemini Robotics 2。这套系统由三个定位互补的核心模型组成,旨在打造具备通用具身智能的机器人解决方案,使其能够胜任从工厂生产到家庭服务的多样化场景。
Gemini Robotics 2系统的三大核心模块分别为:主打全身协同操控的基础执行模型Gemini Robotics 2,负责顶层推理与人机交互的Gemini Robotics ER 2,以及支持离线运行的Gemini Robotics On-Device 2。其中,Gemini Robotics 2能够统一调度机器人的腿部、手臂及指尖等部件,完成包括步行、抓取、搬运在内的各类复杂动作;Gemini Robotics ER 2则集成了环境感知、长流程任务规划等功能,特别新增了多台机器人协同调度能力;而Gemini Robotics On-Device 2的推出,使得机器人能够在无需云端支持的情况下快速适配新设备,大大降低了企业部署门槛。
官方演示视频展示了该系统的强大功能。搭载22自由度五指机械手的Apollo 2人形机器人,可以流畅完成步行、物品收纳、系绳、密封包装袋等多项精细化复合任务。同时,Franka Duo两指机械臂也能高效完成物品规整、工具分类等工作。系统还能够理解并执行复杂的口语指令,例如"将洒水壶收纳至绿色箱体",动作衔接自然连贯。
在安全性方面,谷歌对Gemini Robotics ER 2进行了升级,增加了人体感应机制。当检测到人员靠近作业区域时,机器人会立即启动制动、避让等保护动作,有效规避碰撞风险。
根据官方发布的测试数据,Gemini Robotics 2系列在多个关键指标上均表现出色。在控制真实视觉语言动作(VLA)任务中,成功率达到60.0%,较前代提升了11.4个百分点;在模拟VLA任务中,准确率也达到了42.9%。此外,在人类远程操作(tele-op)任务中,系统表现尤为突出,成功率达到74.0%。
谷歌表示,Gemini Robotics 2是机器人技术从单一自动化操作迈向通用具身智能的关键一步。依托统一的感知、推理与执行框架,这套系统能够大幅拓宽机器人可处理任务的复杂程度,适用于工厂运维、仓储分拣、家政服务等多个领域。随着技术的不断演进,未来机器人有望在更多场景中发挥重要作用,推动各行各业的智能化转型。
图表显示,Gemini Robotics 2在多项性能指标上均优于前代产品,特别是在控制真实视觉语言动作任务中的成功率显著提升,表明其在实际应用中的可靠性和适应性得到了显著增强。