大晓机器人开源ACE-Data-0,1700万帧家庭场景数据集推动具身智能发展
近日,大晓机器人与南洋理工大学S-Lab联合重磅推出全球首个L5级多模态具身物理智能数据集ACE-Data-0,标志着具身智能领域在真实场景数据采集与标注方面取得重大突破。 ACE-Data-0数据集...
近日,大晓机器人与南洋理工大学S-Lab联合重磅推出全球首个L5级多模态具身物理智能数据集ACE-Data-0,标志着具身智能领域在真实场景数据采集与标注方面取得重大突破。
ACE-Data-0数据集基于全球首创的具身模型信息密度定律设计,采用以人为中心的环境式数据采集方案2.0,通过桌面尺度与房间尺度两套互补采集系统,将真实家庭环境转化为可持续记录、统一标定和精准同步的具身数据采集场景。该数据集包含150小时数据、1700万帧视频、200个任务类别、50名参与者、2个真实家庭场景和7.5万个交互片段,覆盖原子级人-物交互、长时序家庭场景活动链及人与场景交互。
具体而言,ACE-Data-0实现了多模态数据的高保真采集与高精度标注,同步采集第一人称视频、多视角第三人称视频、全身与手部运动、物体六自由度轨迹、多通道音频与触觉信号,并将全部模态对齐至同一时间线和空间坐标系。这种设计使不同模态能够共同描述同一个物理过程,完整保留人类感知、行动、接触与环境变化的连续过程。
大晓机器人首席科学家表示,传统数据集往往停留在数秒的单步动作,难以描述真实家庭场景任务中的长期依赖关系。而ACE-Data-0通过连续记录感知、行动、接触和状态变化,让不同模态共同描述同一个物理过程,其重点可以概括为:完整感知、长时序任务、多模态同步。
为了确保多模态数据的准确对应,ACE-Data-0采用了时间同步与空间标定技术,将视频帧、人体动作、物体状态、触觉读数和音频统一到同一条时间线,并配准至共享世界坐标系。这使得研究者可以直接找到某个视频帧对应的人体姿态、物体位置、接触压力和声音变化,也可以比较第一人称与第三人称视角下的同一事件。
ACE-Data-0进一步提供相机参数和同步时间线、人体及手部状态、物体网格与六自由度位姿、边界框、运动轨迹、手-物接触信息,以及与物理时间线对齐的自然语言描述。其中大量标注直接来自经过标定的采集系统,而非完全依赖模型事后估计,这使数据在遮挡、快速运动和长期任务中拥有更稳定的一致性。
大晓机器人创始人兼CEO表示,ACE-Data-0不仅是一批家庭场景活动视频,更是一套面向模仿学习、世界模型、视觉-语言-动作模型(VLA)、机器人策略学习及人类示范向机器人迁移的具身数据基础设施,为通用物理智能走进真实世界提供更完整、更可扩展的数据底座。
"过去几年,视觉语言模型、VLA和世界模型快速发展,但机器人真正进入物理世界后,仍然面临从什么数据中学习人类行动能力的基础问题。"该负责人补充道,"ACE-Data-0通过连续记录感知、行动、接触和状态变化,让不同模态共同描述同一个物理过程,解决了这一难题。"
目前,ACE-Data-0已在全球范围内开源,预计将推动通用物理智能加速跨越实验验证,走向规模化产业落地。大晓机器人计划持续迭代该数据集,不断降低行业研发与落地成本,以自主底层创新推动国产具身智能规模化商用。