Data+AI基础设施进化,从数据链路到智能供给全流程重构
随着具身智能、Agent等新型智能形态的兴起,AI基础设施正经历从模型中心向数据-算法-算力协同演进的关键变革。本文通过分析阿里云、穹彻智能等企业的实践案例,揭示数据处理在AI生产全流程中的核心地位,...
当AI技术从实验室走向真实世界,其基础设施的内涵与外延正在发生深刻变化。在2026年云栖大会上,穹彻智能首席科学家吕峻用一个具身智能的数据版本为例,生动展现了这一转变:从数据采集到进入下一轮模型训练,整个过程可能需要两周甚至更长时间。视频、点云等多模态数据的持续生成,使得数据处理链条变得异常复杂,涉及预处理、质检、标注等多个环节,一条链路中可能发生数十次数据调用。
这种变化让AI基础设施面临前所未有的挑战。过去几年,行业关注的焦点主要集中在GPU数量、集群规模和训练速度上,数据更像是模型训练前的准备阶段。但如今,数据已经贯穿智能产生、应用和优化的全过程。机器人任务产生的视频、点云,科学实验生成的计算结果,以及企业Agent留下的查询轨迹,都成为智能系统持续流动的"血液"。
阿里云智能集团研发副总裁汪军华将这一过程概括为三个阶段:从数据到智能、从智能到应用、从应用到进化。第一个阶段中,海量数据经过处理形成知识与能力;第二个阶段,企业知识和业务数据帮助智能体理解业务场景;第三个阶段,则是应用产生的轨迹和反馈参与下一轮模型优化。
这种转变对基础设施提出了新的要求。传统大数据计算主要依赖CPU,而多模态数据的理解、筛选和标注越来越多地嵌入AI推理过程。阿里云此次升级MaxCompute AI计算引擎,正是为了应对这一挑战。该引擎开始将CPU、GPU与大模型Token调用纳入统一的资源调度管理体系,并通过MaxFrame和SQL AI Function实现Python与SQL数据处理直接调用AI能力。
在具体应用场景中,这种基础设施的进化已经显现成效。在义乌小商品城的商品理解场景中,MaxCompute AI计算引擎每天处理百万级图片,并伴随数十亿级Token调用;在穹彻智能的数据生产管线中,阿里云现场披露的数据吞吐提升超过10倍,同时利用十万级弹性算力单元支撑任务波峰。
这些实践表明,数据处理正在从单一计算变成一种异构资源协同问题。穹彻智能首席科学家吕峻在接受媒体采访时谈到,具身智能目前还处于快速探索期,算法侧经常会产生新的处理算子和标注方法,很难提前固定一套长期不变的数据流水线。这对资源调度提出了更高要求:资源能否随任务临时拉起、任务结束后迅速释放,直接决定了资源会不会长期闲置,也决定一个实验能否及时开始。
更进一步,具身数据正在进入精细化管理阶段。穹彻目前在标注环节已经基本放弃传统人工数据标注,并希望数据处理、质检也越来越多地交由模型完成。一方面,模型标注可以随需求快速扩容;另一方面,当标注规则从A版变成B版时,模型侧可能只需要调整Prompt,而让上百人的人工团队重新理解一套细粒度规则,会产生很高的组织和管理成本。
这也重新定义了所谓的"数据墙"。行业早期讨论数据墙,关注点更多是有没有足够多的数据。进入规模化研发以后,问题开始转向另一侧:已经拥有的大量数据,能否以足够低的成本、足够快的速度,被筛选、理解、质检、标注,并稳定转化成模型真正可以使用的数据。
数据质量管理本身也依赖算法,一旦发现问题,还要尽快把结果反馈回采集端,重新调整下一轮数据生产。数据由此形成了自己的闭环。数据墙、算法墙、算力墙,已经很难分开解决。具身智能真正走向规模化训练和应用,数据、算法和算力几乎构成了现阶段绕不开的三堵墙。
在更宏观的层面,AI计算的核心命题也在发生变化。浪潮信息首席AI战略官刘军指出,当AI从对话工具走进生产系统,产业关注的焦点已经从"有没有足够的算力"转向"这些算力能否持续转化为高质量、可负担的智能服务"。他将这一变化概括为两个演进方向:能力型智算(Capability AI Compute)和容量型智算(Capacity AI Compute)。
能力型智算面向智能前沿,支撑突破智能上限;容量型智算则面向智能普及,实现智能充分供给。刘军认为,计算系统需要以大模型和Agent负载为牵引,统筹算子、内存、互连与整机系统,从局部优化走向端到端协同。
清华大学教授吴华强从存算一体切入,指出面对大模型算力需求快速增长以及传统芯片在面积、带宽等方面的约束,AI算力芯片创新不能只依赖既有技术路径,还需要从新器件、新架构和新计算范式中寻找突破。忆阻器存算一体通过重构计算与存储的关系,减少数据搬移,并通过器件、工艺、电路、架构与软件协同,为高算力芯片发展探索新的技术路径。
数据宝与华为政务一网通军团的合作,则展示了AI基础设施融合千行百业的实践路径。他们发布的"公共数据一张网×华为算力底座"联合解决方案,充分发挥双方禀赋优势,实现能力互补。华为筑牢城市数字基础设施底座,提供算力、存力、大模型推理能力,对地方数据中心、闲置算力进行统一纳管。数据宝依托"公共数据一张网",已对接50余家部委厅局及央企国企、10余个省市及百余家企业数据资源,形成"部委-省市-企业"三级数据资源体系,沉淀1800余项标准数据产品、300余个已验证业务场景。
这种基础设施的进化,不仅体现在技术层面,更反映在商业模式上。未来仅仅增加GPU数量并不能解决全部问题,提高单位计算资源能够产生多少有效Token、完成多少实际任务,将成为智能规模化供给的重要问题。每一次新的智能能力出现时,往往首先是昂贵而稀缺的;随着算法进步、系统优化和工程成熟,这些能力会逐步以更低成本进入更多行业、企业和个人。反过来,更大规模的智能普及,也会产生新的应用、新的数据和新的需求,推动下一轮Capability突破。
总的来说,Data+AI基础设施的进化路径,正在从传统的模型中心向数据-算法-算力协同演进。这一转变不仅改变了AI系统的运行方式,也为整个智能产业的发展开辟了新的可能性。
