高精度:基础门槛

真正的「Model-Ready Data」,高精度、多模态、多样性缺一不可。 在2023年世界人工智能大会(WAIC)主论坛上,亮源新创创始人姜旭提出的一个观点引发了广泛关注:具身智能的数据需求远未达...

人工智能

真正的「Model-Ready Data」,高精度、多模态、多样性缺一不可。

在2023年世界人工智能大会(WAIC)主论坛上,亮源新创创始人姜旭提出的一个观点引发了广泛关注:具身智能的数据需求远未达到上限。他进一步阐述,具身智能本质上是大模型向物理世界的延伸,其发展将遵循“规模化预训练→规模化对齐→规模化部署”的三阶段范式,而这一过程中,数据始终是决定智能供给的核心要素。

然而,尽管互联网沉淀的人类视频已经超过百亿小时,这些数据只能帮助模型“看懂世界”,却无法满足机器人在真实物理环境中完成精准交互的需求。因此,行业真正需要的是可以直接喂给模型、无需二次加工的高质量数据,简智机器人将其定义为「开箱即用」的「Model-Ready Data」。

根据各大具身智能企业的反馈,这种数据必须同时满足三个核心特点:高精度、多模态和多样性,三者缺一不可。

高精度:基础门槛

高精度是「Model-Ready Data」的基础门槛。具体而言,它要求低误差、低延迟和低漂移。例如,手部追踪的厘米级误差会沿训练链路持续放大,最终导致机器人操作失败;传感器之间几十毫秒的时间差,会让模型学到完全错误的因果关系;采集十几分钟后姿态开始漂移,整条数据的价值便大打折扣。

当前行业普通方案的手部关节追踪误差普遍在2-3厘米,这意味着模型看到的手指位置,和真实位置相差整整一个手指的距离。这会导致抓杯子时手指穿进杯壁,拧瓶盖时手指根本没碰到瓶盖,训出来的策略永远抓不准物体。

图片

多模态:能力边界

多模态是决定数据能力边界的关键。真正的人类操作不只是RGB画面,还包含人体姿态、手部轨迹、相机位姿、深度信息、触觉信息等多个维度。纯视觉路线只采集了「人看到了什么」,完全缺失了「人是怎么动的、用了多大劲」的核心信息。

没有手部关节数据,手一被物体遮挡就丢轨迹;没有触觉数据,模型永远不知道抓鸡蛋用多大劲;没有全身姿态数据,动作永远僵硬得像提线木偶。

多样性:泛化上限

多样性决定模型的泛化能力上限。模型要面向一千个家庭、一千种角色,数据就必须从尽可能多的场景中采集。数据价值从来不是堆时长,核心是场景、任务、人物、物体的丰富度。

图片

如果几十万小时数据里90%都是实验室白墙前「拿杯子、拧瓶盖」的重复简单动作,模型训练后只能在演示环境里做固定动作,一到真实场景就失效。

为什么大多数数据公司难以做到这三点?背后的难点各不相同。高精度的核心在于接近100%还原人在现实中的移动与操作过程,这反过来要求强大的算法能力,即通过算法将原始信号转化为精准的结构化数据。多模态的难点在于硬件本身,如果硬件获取能力差、精度低,最终效果就无从谈起。多样性的难点,则考验公司的产品能力和运营体系。

在WAIC上,简智机器人等具身数据基建公司展示了他们在解决这些问题上的最新进展。他们通过全模态头部手部高精度复现人类行为的系统,实现了数据采集的高精度、多模态和多样性,为具身智能的发展提供了坚实的数据基础。

总的来说,具身智能的数据需求正在进入「开箱即用」的时代,但要实现这一目标,还需要行业在算法、硬件和运营体系上持续突破。只有解决了这些关键问题,具身智能才能真正迈向规模化应用。