从被训练到自我进化,具身智能的终局之路

在人工智能领域,具身智能正经历从数据驱动向自我进化的范式转变。上海交通大学穆尧教授及其团队通过RoboTwin等项目,推动机器人从依赖外部训练转向自主学习与迭代。文章深入探讨了这一技术演进的关键节点,...

人工智能

在人工智能的版图中,具身智能正迎来一场深刻的范式革命。2026年,上海交通大学长聘教轨助理教授、SeeAct AI创始人穆尧的研究团队发布的一项成果,清晰地勾勒出这一领域的未来路径:从"被训练"走向"自我进化"。这一转变不仅标志着技术突破,更预示着机器人能力的本质跃迁。

穆尧的研究始于2021年香港大学MMLab实验室,当时具身智能领域尚处于探索初期。没有成熟的数据集,也没有统一的技术标准,但穆尧凭借对强化学习的深刻理解,坚持将奖励驱动策略应用于机器人系统。他主导开发的RoboTwin平台,通过代码生成构建仿真环境,为机器人提供了自主学习的实验场。GitHub上超过2900颗星的关注度,印证了这一方向的潜力。

"真正的挑战不在于数据量,而在于经验的积累与传递。"穆尧在接受采访时表示。他的研究团队通过构建虚拟仿真环境,让机器人能够在模拟世界中进行自我探索和策略优化。这种"在线探索"机制,结合离线数据的深度利用,形成了一个完整的自我改进闭环。图4展示的"Dreaming-based Policy Improvement"流程,正是这一理念的具体实现。

然而,具身智能的自我进化之路并非坦途。补充素材显示,尽管AI系统在研发环节的参与度已显著提升(如Anthropic内部AI完成的研发工作占比从不足1%升至26%),但在真实世界的部署中,如何将每次交互转化为可复用的知识,仍是亟待解决的核心问题。"部署不是终点,而是新的起点。"穆尧强调,只有当机器人能够从每一次真机试错中提取有效信息,并将其反馈到后续版本时,真正的自我进化才能实现。

文章配图

当前,行业普遍面临"Demo惊艳、落地困难"的困境。预训练模型虽然提供了基础能力,但缺乏持续改进机制。清华大学智能产业研究院的曹婷教授提出的"具身自进化"概念,为破解这一难题提供了新思路。通过"因果先验+上下文因果学习"双技术体系,机器人能够在真实交互中不断优化自身性能。Zeva-Ego模型的成功应用,证明了这一方法的有效性:仅需少量人类视频数据,即可显著提升机器人的任务执行能力。

文章配图

展望未来,具身智能的自我进化将重塑整个机器人产业格局。正如张亚勤院士所描绘的"一脑多形"愿景,轮式、四足、人形机器人将通过自进化能力,在不同场景中实现性能的持续提升。这一趋势不仅将推动技术进步,也将加速具身智能从实验室走向规模化应用的步伐。