HSImul3R发布,让机器人从人类视频中学习物理可执行交互
大晓机器人联合南洋理工大学和上海人工智能实验室推出全球首个可仿真的人-场景交互重建框架HSImul3R。该框架突破三维视觉与物理仿真鸿沟,通过物理闭环优化实现人-场景交互的稳定重建,并将成果应用于真实...
在计算机视觉领域,如何让机器理解并复现人类在真实世界中的物理交互一直是重大挑战。近日,大晓机器人(Da Xiao Robotics)联合新加坡南洋理工大学S-Lab、上海人工智能实验室共同发布了全新研究框架HSImul3R,标志着三维重建技术从"视觉正确"迈向"物理可执行"的重要突破。
HSImul3R的核心创新在于其提出的"物理闭环(Physics-in-the-Loop)双向优化框架"。不同于传统方法主要关注视觉上的重建准确性,该框架将重力稳定性、真实接触和交互稳定性等物理约束纳入重建过程。团队通过正向的面向场景强化学习(Scene-targeted Reinforcement Learning)优化人体运动,确保动作不仅符合动力学原理,还能与特定场景形成真实的物理交互;同时利用反向的直接仿真奖励优化(Direct Simulation Reward Optimization, DSRO),以物理仿真的交互结果作为监督信号,反向优化三维场景结构。
为验证这一新方法的有效性,研究团队构建了专门针对人-场景交互的HSIBench基准数据集。该数据集包含19个场景物体、超过50段人体动作序列和300个独立交互实例,由3名参与者从16个视角同步采集。实验结果显示,在Easy、Medium、Hard三档任务中,HSImul3R的交互稳定率分别达到53.68%、30.56%和13.92%,显著高于传统方法HSfM的10.52%、4.50%和2.66%,并将人-场景三维穿模率从69.51%降至22.90%。
为了验证研究成果的实际应用价值,研究团队进一步将优化后的人体动作迁移到Unitree G1人形机器人上。首先,通过运动重定向将优化后的动作适配到机器人模型;然后,在仿真环境中训练全身控制策略;最后,直接部署到真实机器人上,使其能够在现实环境中复现相应的人-场景交互。
这一完整链路的打通,意味着机器人可以从日常图像或视频中学习复杂的物理交互技能,而不仅仅是模仿视觉动作。例如,当看到一个人坐在椅子上时,机器人不仅能理解这个动作,还能掌握如何在真实环境中安全地完成同样的交互,包括椅子的承重能力、人体与椅面的接触方式等关键物理特性。
HSImul3R的研究成果已被全球计算机视觉顶级会议ECCV 2026正式接收,标志着该方向在学术界获得广泛认可。尽管目前仍面临复杂交互、多物体场景和动态环境等挑战,但这一框架已经为机器人学习人类技能提供了重要方向:未来的机器人不应只是"看起来像"人类,更应该能在真实物理世界中"真正做得到"人类的动作。