Video2DoorTraversal,机器人仅需一段视频,就能学会开门穿越

对人类而言,推门是一种几乎无需思考的日常动作。然而,对于移动操作机器人来说,这却是一个集感知、移动、操作和控制于一体的复杂任务。机器人需要精确找到并接触门把手,协调机械臂与底盘完成旋转开门动作,同时还...

人工智能

对人类而言,推门是一种几乎无需思考的日常动作。然而,对于移动操作机器人来说,这却是一个集感知、移动、操作和控制于一体的复杂任务。机器人需要精确找到并接触门把手,协调机械臂与底盘完成旋转开门动作,同时还要避开门框并在狭窄空间中顺利穿越。任何环节出现误差,都可能导致任务失败。

近日,由纽娲机器人、上海交通大学和山东大学研究人员共同完成的一项研究,为解决这一难题提供了新的思路。这项名为 "Video2DoorTraversal" 的技术框架,首次实现了仅需一段普通 RGB 视频,即可让轮足移动操作机器人学会开门并穿越门体。

核心创新:从视频到数字孪生再到真机验证

该技术的核心在于 "DoorTwin" 数字孪生模型的构建。系统首先从单段 RGB 视频中恢复门的真实尺度几何信息和相机运动轨迹,识别门板、把手及铰链关系,生成包含关节、碰撞几何和外观纹理的数字资产。为了确保数字门既在视觉上接近真实对象,又能在物理上被机器人操作(如抓住、转动和推开),系统会持续修正生成结果,直到满足这两个条件。

随后,系统在仿真环境中生成并筛选成功轨迹。一条轨迹失败后,系统会根据碰撞、接触、把手旋转和门体开启状态分析原因,在邻近参数中继续搜索。只有通过任务、碰撞和运动学验证的成功轨迹,才会被保留为训练数据。这种基于仿真闭环代理的训练方式,避免了针对每扇门进行真人遥操作采集。

实验验证:高成功率与跨门迁移能力

研究团队在论文指定的轮足移动操作平台上进行了全面测试。针对五扇真实推门,每扇门各测试 35 次,共完成 175 次测试,其中成功 169 次,平均成功率达到 96.57%。更令人印象深刻的是,在三扇结构相似但训练阶段未见过的门上,策略无需增加目标门训练或重新生成轨迹,零样本平均成功率为 80.95%。

从接近门到完成开门和穿越,整个过程平均用时约 13 秒,且视觉处理与策略推理均在机器人本地完成,无需云端计算支持。

图片

技术意义与产业价值

这项研究的意义不仅在于展示了机器人在特定任务上的高成功率,更重要的是为观察机器人场景适配能力提供了一组可复核的结果。对投资人和产业界而言,更关注的问题是:面对新的真实对象,场景信息能否通过轻量采集转化为仿真资产,再转化为可以在真机上执行的策略?

Video2DoorTraversal 提供了一个清晰的路径:从单段视频到数字孪生、仿真训练和真机验证。这表明,通过一段视频可以让同一策略覆盖任意门,为通用开门产品或规模化交付能力奠定了基础。

未来方向与挑战

尽管取得了显著成果,但研究团队也指出,当前主要处理的是推门场景,拉门、更多把手机制和更丰富的门体结构仍属于后续方向。此外,如何将仿真资产与训练数据跨设施、跨场景和跨本体复用,缩短新项目的适配周期,减少现场试错与人工介入,也是下一步需要解决的关键问题。

这项研究还展示了具身智能技术在开放人类环境中的潜力。通过将空间理解、任务判断、导航和具身操作组织在同一智能底座中,机器人有望在更复杂的环境中完成连续任务。这对于推动具身智能技术的实际应用具有重要意义。

图片