李飞飞吴佳俊联手突破机器人动作难题,TrAct解决世界模型与控制语言鸿沟

在人工智能与机器人技术深度融合的今天,如何让机器人像人类一样理解并执行复杂任务,一直是学术界和产业界关注的核心难题。近日,斯坦福大学计算机科学系教授李飞飞与吴佳俊团队发表了一项突破性研究成果,为解决这...

人工智能

在人工智能与机器人技术深度融合的今天,如何让机器人像人类一样理解并执行复杂任务,一直是学术界和产业界关注的核心难题。近日,斯坦福大学计算机科学系教授李飞飞与吴佳俊团队发表了一项突破性研究成果,为解决这一难题提供了全新思路。

图片

该研究以题为《TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks》的论文形式发表于arXiv平台。论文中,两位学者首次提出利用视觉轨迹(Visual Tracks)作为中间桥梁,实现机器人动作控制与世界模型预测之间的高效对接。这种创新方法被形象地称为“同声传译”,旨在消除两者之间存在的“巴别塔”障碍。

背景显示,当前具身智能领域的主流解决方案是通过世界模型(World Model)对机器人动作进行预演。然而,这种方案存在显著缺陷:机器人控制器输出的是低维的动作指令(如关节角度、末端位姿等),而世界模型需要处理的是高维的像素级画面数据。例如,一个简单的“夹取面条放入碗中”动作,就需要跨越从低维数字到百万像素画面的复杂转换过程,这导致了预测结果的不准确性和跨机器人本体的泛化困难。

针对这一挑战,TrAct 系统通过以下核心机制实现突破:首先,系统利用视觉轨迹将机器人动作转化为连续的像素级运动路径;其次,这些视觉轨迹作为中间变量,连接了动作控制模块与世界模型预测模块;最后,通过视觉语言动作评判器(Vision Language Action Critic, VLAC)选择最优动作组合。实验结果显示,该方法在多个模拟和物理机器人任务中均表现出色,显著提升了机器人动作的准确性和泛化能力。

图片

这项研究不仅解决了具身智能领域长期存在的技术瓶颈,也为未来机器人在真实场景中的应用奠定了重要基础。据团队介绍,该技术已成功应用于第二届世界人形机器人运动会啦啦操项目,帮助参赛队伍零失误完成高难度动作编排,最终获得亚军。这充分证明了TrAct系统的实际应用价值。

业内专家认为,TrAct的研究成果标志着具身智能领域进入了一个新的发展阶段。通过解决机器人动作与世界模型之间的语言鸿沟问题,该技术有望推动机器人从实验室走向更广泛的实际应用场景,包括智能制造、医疗辅助、家庭服务等多个领域。随着相关技术的不断成熟,未来的机器人将能够更好地理解和适应复杂多变的真实环境,真正实现“像人类一样思考和行动”的目标。