无问芯穹发布Agentic Infra战略,三大核心技术赋能AI基础设施
随着计算需求的指数级增长,单纯依靠产能线性增长已无法满足日益扩大的算力供需缺口。在2026年世界人工智能大会(WAIC)上,无问芯穹联合创始人兼CEO夏立雪提出,从预训练到后训练,再到推理时扩展和智能...
随着计算需求的指数级增长,单纯依靠产能线性增长已无法满足日益扩大的算力供需缺口。在2026年世界人工智能大会(WAIC)上,无问芯穹联合创始人兼CEO夏立雪提出,从预训练到后训练,再到推理时扩展和智能体扩展,模型训练和推理的超级市场正在互相孕育。基于此,无问芯穹首次公布了其Agentic Infra "前店后厂一中心"战略布局,旨在打造极致效率的人工智能基础设施。
该战略的核心是构建一个自主式基础设施平台,通过三大核心技术能力与产品服务体系,实现智能资源规模最大化。具体而言,Agentic Infra包括三个主要部分:算力集散中心、Token工厂和AI生产力商店。其中,算力集散中心负责将分散的、异构的算力资源统一汇聚、弹性调度和按需分发;Token工厂则专注于提升Token转化效率;AI生产力商店则向上支撑模型和应用开发。
在技术实现层面,无问芯穹通过多元异构、软硬协同的技术破解了异质算力聚合的难题。其跨域训练系统已经过三大类跨域算力聚合训练实践的生产级考验:
• 超远距离聚合:与电信合作完成国内首例超4000公里距离的大模型跨域混训,在新疆哈密与广东深圳两地集群间实现联合训练性能提升165%。
• 多数据中心聚合:打通4个不同代际、不同型号的GPU集群,联合训练近百亿参数大模型,四集群协同性能提升41%。
• 混合云算力聚合:实现本地私有集群与公有云算力的安全互通混训,整体性能提升68%。
目前,这套跨域训练系统已在全国部署触达超37,000P算力,覆盖16种主流芯片,有效盘活了广域分散的异质算力资源。
针对强化学习这一下一代AI进步的重要手段,无问芯穹特别关注跨集群强化学习场景。该场景存在两大关键挑战:一是跨集群后不同角色之间的等待时间延长;二是大规模集群(万卡级以上)故障频发导致任务难以持续稳定运行。为此,无问芯穹从网络、平台到框架进行一体式深度优化,实现了全局资源一盘棋调度,并通过优化计算通信重叠技术,让跨域通信效率提升3-4倍,同时搭建了故障无感的训练机制,成功实现跨域强化学习训练连续一周0中断稳定运行。
夏立雪表示,这只是起点,未来无问芯穹将继续深耕并行策略、通信融合、智能算子、极致容错等核心技术,将跨域计算资源的支撑规模拓展至十万卡级以上,为下一代Agentic AI的在线进化提供持续支持。