具身智能数据缺口突围,从千万小时到百万小时的跨越

具身智能正加速从实验室走向现实,但其发展面临核心数据缺口。行业数据显示,要实现具身智能的“ChatGPT时刻”,至少需要千万小时级的真实动作数据,而当前全球可用高质量数据仅数十万到百万小时。本文探讨了...

人工智能

在人工智能领域,大语言模型凭借海量文本数据实现了快速爆发,而机器人要掌握拧瓶盖、叠衣服等日常技能,却面临着一个关键难题:缺乏真实世界动作数据的积累。这种数据缺口不仅制约了具身智能的发展速度,也成为其大规模落地的重要障碍。

根据中国信通院联合发布的《具身智能训练场研究报告(2026年)》,具身基础模型要迎来自己的"ChatGPT时刻",至少需要千万小时级的真实数据。如果这些数据全部靠真机采集,按每台机器人每天有效工作2小时、每年工作300天计算,需要超过两万台机器人连续工作整整一年。然而,当前全球可用的高质量真实数据,只有数十万到百万小时级,供需之间隔着一整个量级。

数据的杠杆效应已经在海外被验证。今年9月,美国人形机器人公司Figure发布Helix 2.5模型,通过使用人类行为数据集Index进行预训练,模型在陌生环境中的任务完成率达到了56%,而对照组仅为9%。这一差距直接揭示了人类行为数据预训练的真正价值——它让机器人第一次能在陌生环境里"直接上岗"。

面对如此巨大的数据缺口,行业正在经历一场深刻的变革。觅蜂科技董事长兼CEO姚卯青指出,行业对数据的需求曲线正在陡峭地上升。去年上半年,市面上很少有人提几十万小时规模,大家还停留在一万小时的量级;到去年底有人做到20万小时;今年很快就有公司宣布用到100万小时,而他接触到的客户,提出的已是千万小时级的预算。

"不是简单地堆量,"姚卯青强调,"而是越来越往细分赛道、专业技能上去获取。"叠衣服的数据已经泛滥,修水管、修车、理发、美甲等"长尾技能"正等待被一个个点亮、解锁。

在此背景下,具身智能的数据故事才刚刚翻到第一章,在数量的缺口之外,质量和场景多样性的缺口同样悬而未决。谁能持续把真实世界的经验转化为可训练的数据,谁就握住了下一个十年的入场券。

在数据采集方面,行业此前最通行的做法是真机遥操作:人通过手柄或VR设备操纵机器人,把任务操作示范给模型。这类数据与本体高度对齐,训练价值高,但短板同样明显——采集速度被机器人数量、操作人员和场地死死捆住,硬件、人力与运营成本随数据规模同步上涨。

更深层次的痛点在于场景本身。觅蜂科技副总裁殷哲将数据采集比作挖矿:设备是工具,运营是工厂,场景资源才是要挖的矿。"在整个物理AI数据链条里,场景是唯一无法被技术或资本快速复制的源头。"

当前国内真实物理交互场景的合规数据大约只有100万小时,而机器人商业化落地需要千万甚至数亿小时,缺口超过99%。更麻烦的是,场景进入有壁垒,比如,设备进食品厂安全吗?老板让不让众包员带设备进工厂?

图2

"场景像页岩油,有价值,但如果开采成本比采出来的油还贵,就等于没有。"姚卯青打了个更形象的比方。

面对这一困境,行业正在探索新的解决方案。杭州美梦空间科技有限公司(Memo)给出了一个创新思路:基于可观测数据与深层物理数据训练的Physical-WAM物理-世界动作模型,以及业内首个RoboTwin-phys物理漂移评测基准。这套技术架构旨在让机器人从"模仿"走向"理解",具备人类式的预判能力。

"机器人缺少对物理世界的基础认知,是双重困境叠加的结果。"美梦空间CEO李明昊表示,"第一重困境来自数据鸿沟,第二重困境是测评标尺的缺位。"

随着AI智能体的爆发式增长,具身智能的数据需求也在加速上升。IDC预测,全球活跃智能体数量将从2026年的7940万个增长至2030年的22.16亿个,复合增长率达129.8%。与此同时,Token消耗量复合增长率达4822.6%,约为活跃智能体数量增速的37倍。

图3

"智能体正在成为人工智能投入的重要增量。"IDC副总裁周震刚在接受记者采访时表示,"预计整体爆发式增长集中在今明两年。"

在算力方面,浪潮信息与IDC联合发布的《2026年中国人工智能计算力发展评估报告》显示,2026年中国智能算力规模将达到2576.5EFLOPS,同比增长87.9%;到2030年将达到10524.3EFLOPS,2025-2030年复合增长率达50.3%。

"智能体应用已从‘谈智能体’进入‘用智能体’阶段。"周震刚说,"预计整体爆发式增长集中在今明两年。"

展望未来,具身智能的数据缺口问题将成为决定行业发展的关键因素。只有通过技术创新、运营升级和生态合作,才能真正突破这一瓶颈,推动具身智能从实验室走向千家万户。