网通社科技快报
NVIDIA机器人听声技术突破 多模态感知提升交互能力
在ECCV 2026会议上,NVIDIA Research科学家Boyi Li分享了其团队在机器人多模态感知领域的最新研究成果。该研究旨在解决机器人训练中声音和操作数据难以获取的难题,为机器人赋予“听觉”能力,从而提升其在真实环境中的交互表现。
Li博士指出,仅具备视觉能力的机器人无法全面理解复杂环境。声音信息在机器人判断液体容量、识别物体材质以及感知周围环境时至关重要。然而,真实世界的声音数据采集成本高昂且耗时,成为具身智能发展的瓶颈。为此,Li团队提出了两条创新路径:一是MultiGen技术,利用生成模型为物理模拟器生成同步声音,使机器人能够“听到”仿真环境中的声音;二是DexImit技术,通过分析人类操作视频恢复双手与物体的交互过程,并将其转化为机器人可学习的数据,大幅降低数据采集成本。
演示环节展示了MultiGen的实际效果:结合视觉和声音信息后,机器人在判断液体容量时的误差显著降低。此外,对比传统物理模拟器与模拟多模态数据集的效果表明,新技术能显著提升机器人对复杂任务的适应能力。
Li博士表示,这些技术不仅提高了机器人训练效率,还为其在真实场景中的应用提供了重要支持。未来,随着多模态感知能力的增强,机器人将更像人类一样通过多种感官理解并适应环境,为具身智能的发展开辟新方向。
Li博士指出,仅具备视觉能力的机器人无法全面理解复杂环境。声音信息在机器人判断液体容量、识别物体材质以及感知周围环境时至关重要。然而,真实世界的声音数据采集成本高昂且耗时,成为具身智能发展的瓶颈。为此,Li团队提出了两条创新路径:一是MultiGen技术,利用生成模型为物理模拟器生成同步声音,使机器人能够“听到”仿真环境中的声音;二是DexImit技术,通过分析人类操作视频恢复双手与物体的交互过程,并将其转化为机器人可学习的数据,大幅降低数据采集成本。
演示环节展示了MultiGen的实际效果:结合视觉和声音信息后,机器人在判断液体容量时的误差显著降低。此外,对比传统物理模拟器与模拟多模态数据集的效果表明,新技术能显著提升机器人对复杂任务的适应能力。
Li博士表示,这些技术不仅提高了机器人训练效率,还为其在真实场景中的应用提供了重要支持。未来,随着多模态感知能力的增强,机器人将更像人类一样通过多种感官理解并适应环境,为具身智能的发展开辟新方向。