GPT-6Astra赋能机器人!清华开源RPent推动具身智能发展
通用大模型GPT-6 Astra正被用于驱动物理世界的机器人。清华大学联合无问芯穹等机构开源的RPent基础设施,通过整合通用大模型与专家模型能力,使机器人能在真实环境中持续学习和进化,任务成功率达9...
近年来,随着人工智能技术的快速发展,通用大模型在代码生成、文本理解等领域展现出强大能力。然而,当这些模型被应用于物理世界时,如何让它们真正理解和执行复杂任务成为了一个重要课题。
近日,清华大学联合无问芯穹、正行创新等机构推出了一项名为RPent的具身智能体基础设施,并将其开源。这一系统的核心在于将GPT-6 Astra这样的通用大模型作为决策大脑,结合视觉语言模型(VLA)等专家模型的能力,构建了一个完整的闭环系统,使机器人能够在真实环境中自主完成任务。
RPent的设计理念是让机器人不仅"想得明白",还要能"看得见、做得到、反应快、记得住"。它通过三个核心模块实现这一目标:首先,利用通用大模型进行任务理解和规划;其次,借助VLA等专家模型处理精细操作;最后,通过记忆机制记录经验并优化后续行为。
在LIBERO-PRO基准测试中,采用RPent系统的机器人达到了92.6%的任务成功率,端到端任务完成速度优化了7倍以上。这表明,通过这种方式,机器人可以更好地适应环境变化,并将经过验证的经验转化为可复用的能力。
具体来看,RPent系统包含三层接口设计:从大模型到物理设备,通过MCP(基础模型)、RPC(工具与动作原语)和MHS(设备级抽象)三段标准接口串联起完整链路。这种设计使得机器人能够灵活应对各种任务场景,例如在不同环境下调整动作策略,或者组合已有技能完成新任务。
一个典型的例子是,当任务要求将干净餐具放入纸箱时,冻结VLA只会沿用训练时学到的动作,将盘子错误地放入金属篮中;而在RPent系统中,智能体会先观察当前环境,再根据新的目标选择放置位置。如果视觉定位出现偏差,它还会检查结果、排除错误目标,并重新定位手中的盘子。
此外,RPent还展示了对已有能力的复用。例如,机器人可以将原本用于"拿起并放置容器"的技能重新组合,用于倾倒钢珠;又可以把抓取动作与双臂协同、持续接触组合起来,完成持盘、擦拭和收纳等任务。这些功能都通过Task Card的形式沉淀下来,供后续任务调用。
值得注意的是,RPent的成功并非偶然。其核心技术团队来自RLinf,他们在具身智能基础设施领域积累了丰富的经验。开源代码链接为https://github.com/RLinf/RPent,欢迎开发者参与改进和扩展。
这一进展引发了业界广泛关注。过去几年,机器人行业一直在寻找类似OpenAI那样的基础模型,而GPT-6 Astra的表现似乎给出了一个明确的答案。正如CMU Robotics的Wenli Xiao所展示的,通过简单的视频输入,Astra就能控制机械臂完成新任务,这被称为"physical ICL"(物理世界中的上下文学习)。
另一个值得关注的例子是RoboCurve的研究。他们将GPT-6 Astra连接到两只真实的I2RT YAM机械臂上,在测试中成功完成了19次抓取红色积木放入碗里的任务,成功率高达95%,远超现有解决方案。
总的来说,RPent的开源标志着具身智能领域的一个重要里程碑。它不仅展示了通用大模型在物理世界中的潜力,也为机器人技术的发展提供了新的思路。未来,随着更多研究者加入,我们有望看到更加智能、灵活的机器人在各个领域发挥作用。