NVIDIA李柏依,机器人听声技术突破,多模态感知提升交互能力

在ECCV 2026会议上,NVIDIA Research科学家Boyi Li分享了两项关于机器人多模态感知的研究。通过生成模型为仿真视频补全声音(MultiGen)以及从人类操作视频中提取双手交互数...

人工智能

在计算机视觉领域深耕多年的NVIDIA Research科学家Boyi Li,近日在ECCV 2026的Workshop上分享了其团队在机器人多模态感知方面的最新研究成果。这项研究不仅为机器人赋予了"听觉"能力,更通过创新的数据生成与转换方法,解决了长期以来困扰具身智能发展的数据采集难题。

"机器人要真正融入真实世界,仅仅具备视觉能力是远远不够的。"Li博士指出,声音信息在机器人理解环境、执行任务时扮演着关键角色。例如,在倒水过程中,声音可以帮助判断杯子是否即将溢出;不同材质物体碰撞时发出的独特声响,也能为机器人提供重要的环境线索。然而,这些对人类而言习以为常的多模态感知,在机器人的训练阶段却面临着高昂的数据采集成本。

针对这一挑战,Li博士团队提出了两条创新路径。第一条路径是MultiGen,该方法利用现实世界中的视频和音频数据训练生成模型,为传统物理模拟器生成同步的声音。"我们尝试用生成模型来补足仿真系统中缺失的感知信息,"Li博士解释道,"这就像给机器人装上了耳朵,让它能够听到仿真世界的声音。"

第二条路径则是DexImit,该方法通过分析人类操作视频,恢复其中的手部与物体交互过程,并将其转化为机器人可以学习的双手操作数据。"我们发现,很多复杂的双手灵巧操作其实可以通过人类示范视频来间接获得,"Li博士补充道,"这种方法大大降低了数据采集的成本。"

这两项技术的核心在于将难以直接获取的感知和交互信息转化为机器人可以学习的数据。通过这种方式,不仅提高了机器人训练的效率,也为其在真实世界中的表现提供了重要支持。

在演示环节,Li博士展示了MultiGen技术的实际效果。投影屏幕上显示了一组对比图表,清晰地表明,在结合视觉和声音信息后,机器人在判断液体容量时的平均绝对误差显著降低。此外,另一个演示则对比了传统物理模拟器与模拟多模态数据集的效果,直观地展现了新技术在提升机器人交互能力方面的潜力。

文章配图

"我们的目标是让机器人能够像人类一样,通过多种感官来理解和适应环境,"Li博士总结道,"这些技术的进步将为具身智能的发展开辟新的道路。"

这项研究不仅展示了NVIDIA在机器人多模态感知领域的前沿探索,也为整个行业提供了新的思路和解决方案。