李飞飞领衔新研究,视频模型直接赋能机器人操作

近日,人工智能领域迎来一项重磅研究成果。由著名学者李飞飞(Fei-Fei Li)与斯坦福大学助理教授Yilun Du领衔的研究团队,在arxiv上发布了一篇题为《Masked Visual Actio...

人工智能

近日,人工智能领域迎来一项重磅研究成果。由著名学者李飞飞(Fei-Fei Li)与斯坦福大学助理教授Yilun Du领衔的研究团队,在arxiv上发布了一篇题为《Masked Visual Actions for Unified World Modeling》的论文。这项研究首次提出将成熟的视频生成模型直接应用于机器人控制,彻底颠覆了传统机器人需要构建专属大模型的认知。

图片

该研究的核心创新在于开发了一种名为"Masked Visual Actions"(MVA)的技术接口。通过这种接口,视频生成模型能够理解并生成机器人动作指令,实现了从视觉理解到物理操作的无缝衔接。实验结果显示,仅需15小时的数据微调,机器人就能从单臂操作成功泛化到未见过的双臂系统,展示了惊人的跨场景适应能力。

这一突破性进展背后,是多位顶尖学者的通力合作。除了李飞飞和Yilun Du,研究团队还包括斯坦福计算成像实验室负责人Gordon Wetzstein、机器人基础模型核心推动者黄文龙等十多位专家。值得注意的是,Yilun Du与李飞飞在具身智能领域的不同研究路线此前鲜有交集,此次合作被视为人工智能研究的重大转折点。

李飞飞在接受a16z访谈时表示:"我们正在探索让AI不仅能看懂世界,还能动手改变世界的新路径。视频生成模型已经具备强大的物理直觉,但缺乏与机器人交互的语言接口。通过MVA技术,我们找到了这个关键的‘翻译器’。"

图片

这项研究对产业界的影响同样深远。目前,机器人领域普遍面临训练数据匮乏和评估成本高昂的问题。通过利用现有的视频生成模型,企业可以大幅降低机器人开发成本,同时提高系统的通用性和适应性。World Labs首席执行官李飞飞表示:"这将彻底解决工厂机械臂更换时需要重新训练的痛点,让机器人真正成为灵活可变的生产力工具。"

业界专家认为,这项研究标志着人工智能从感知智能向具身智能的重要跨越。它不仅解决了机器人领域长期存在的难题,也为未来AI在物理空间中的应用开辟了全新路径。随着这项技术的进一步发展,我们或许即将看到更多能够自主学习和适应复杂环境的智能机器人出现在工业生产、家庭服务等多个领域。