具身智能数据生意存隐忧,真实采集成本高企,仿真数据难补短板

梅卡曼德创始人邵天兰公开质疑具身智能企业通过关联交易和数据循环包装营收,引发行业热议。国内机器人企业真实数据需求不足1%,但各地提前建设数采中心导致‘为采而采’现象,有效数据比例极低。触觉数采标准缺失...

人工智能

近日,具身智能行业迎来一场关于数据生意的公开论战。梅卡曼德创始人邵天兰在朋友圈直指部分高估值企业通过关联交易、数据采集中心及地方资源包装营收数据,以此冲刺IPO、谋求资本上市。此番言论不仅点名银河通用,更将行业内心照不宣的隐秘争议彻底摆上台面。

一石激起千层浪。针对此次质疑,银河通用官方迅速作出回应,表态不愿参与行业口水纷争,将持续深耕技术研发、场景落地与商业化推进。然而,这一事件背后折射出的却是更为本质的问题:机器人企业究竟需要什么数据?数采中心生产的数据是否真正进入模型?设备订单和数据交易又该如何判断实际价值?

要理解这些问题,必须回到一条数据产生、流转并进入模型的全过程。霞光社对话了三位身处数采行业的从业者,分别从真实数据、订单需求和触觉数采出发,呈现出这门生意正在经历的变化。

物理AI数据创业者黄大荣指出,中国具身智能数采存在明显卡点。如果只看机器人出货量,中国具身智能似乎已经走得很快。但出货量只能反映产业化进度,机器人能否在真实场景中完成任务,最终还要回到模型能力。

OpenAI积累的原始数据已达到千万小时级别,这还仅是保守估算。为其供给数据的海外机构,单月采集量便可达到百万小时。反观国内,简智、光轮两家企业同样具备单月百万小时的采集能力,但市场上愿意大规模采购Ego数据的买家寥寥无几。

如此悬殊的差距,很容易让人想到一条‘捷径’:真实采集既慢又贵,能不能直接依靠仿真和合成数据追上去?可以是可以,但现阶段恐怕很难。

自动驾驶已经走过一遍类似的路。最初,大量汽车先要在真实道路上运行,积累几千万甚至上亿小时的数据。只有模型见过足够多的道路、天气和突发情况后,合成数据才有参照,才能补充那些危险、低频或难以重复的场景。现在的具身智能,更像自动驾驶的早期阶段。真实物理世界的样本底座还没有建立起来,模型甚至没有充分见过杯子如何滑落、人在狭窄空间里如何调整动作。这个时候只谈仿真,很容易生成一段‘看起来合理’的视频,却无法让机器人在现实中稳定完成任务。

既然真实数据采集那么重要,为什么国内的具身公司购买Ego数据量这么少呢?答案其实很简单,就是因为钱不够。

我们可以来算一笔账:一套采集设备可能要两三千元,再加上采集人员,按照全球平均水平估算,仅人工成本就接近每小时15美元。把这个数字乘以一千万,就能明白为什么数据规模不是多建几个数采中心、增加一些工位就能堆出来的。

文章配图

并且数采也不是说量堆够采够了就行了,模型在早期需要的是广度,要先‘见过世界’。因此,采集需要覆盖世界各地不同的国家和地区,让机器人接触不同的职业、家庭和生活环境。比如菲律宾的铁皮房、柬埔寨的茅草屋,都是有价值的,它们能让模型知道,人类并不都生活在标准化公寓里。

但广度数据只能帮助模型完成前期预训练。当机器人准备进入具体市场,采集就必须从‘看得多’迈向‘学得深’,围绕目标场景反复训练。例如,面向中国家庭的机器人,需要熟悉本地家庭的空间、物品和生活习惯;面向北美商超或咖啡厅,则必须到当地采集。店内员工可以签署拍摄协议,但营业期间不断进出的顾客很难逐一授权。因此,真正接近商业场景的数据,最难拿到,也最昂贵。

触觉数采方面,标准尚未统一,一致性问题亟待解决。物理数据无法被仿真替代,3-5年内真实数据仍是训练基石,工业场景可能早于家庭释放数据需求。

行业分化已经开始显现。能进入真实场景并形成‘采集-训练-反馈-补采’闭环的数采中心才能持续;仅做通用动作采集的中心若无独立第三方采购,易沦为关联交易工具,最终被淘汰。