1024卡规模业界最大!华为发布昇腾950超节点突破大模型训练瓶颈

在2026世界人工智能大会上,华为首次推出业界最大规模的昇腾950超节点AI集群。该产品采用1024张昇腾950DT NPU芯片,通过自研灵衢2.0全光互联协议实现跨机柜高速通信,总互联带宽达1.72...

人工智能

9月21日,在2026世界人工智能大会(WAIC)上,华为正式对外展示了其最新研发的昇腾950超节点AI集群。这款产品以1024张昇腾950DT NPU芯片为核心,构建了一个逻辑统一的超级计算机系统,旨在解决大规模大模型训练中多卡通信延迟这一行业痛点。

昇腾950超节点采用模块化设计,标准配置包含16台计算柜和4台灵衢互联柜,最高可扩展至1024张昇腾950DT NPU芯片,并配套256颗鲲鹏950 CPU。整套系统提供高达1 EFLOPS FP8算力和2 EFLOPS FP4算力,单颗昇腾950DT NPU搭载HiZQ 2.0 HBM高带宽内存,容量达144GB,带宽4TB/s,支持FP16、BF16、FP8、MXFP4等多种精度AI计算。

核心技术创新在于其自研的灵衢2.0全光互联协议。该协议实现了跨机柜的全光Mesh直连,总互联带宽达到1.72PB/s,跨柜往返时延低至3微秒。同时支持256TB全局内存统一编址,上千张NPU可以共享内存空间,无需在多台独立服务器间搬运海量模型数据,大幅降低通信损耗。

文章配图

散热方面,昇腾950超节点采用全液冷方案,单柜最高支持100kW大功率供电,确保高密度算力持续稳定运行。可靠性设计上,灵衢链路支持闪断自恢复,具备2+2光路保护机制,即使部分链路故障,业务也不会中断,满足7*24小时不间断大模型训练需求。

软件生态方面,该产品依托昇腾CANN全栈软件平台,提供完整的开发工具链,支持模型迁移和分布式训练优化。传统AI集群中,多台服务器间的数据交换开销巨大,随着卡数增加,算力利用率往往会下降。而昇腾超节点通过打破服务器物理边界,让上千颗NPU如同单台设备协同计算,显著提升了万亿参数大模型的训练效率,特别适配Agent智能体、超长上下文大模型等高算力需求场景。

值得注意的是,与上一代产品相比,昇腾950超节点不仅在硬件规模上实现了翻倍增长,还在软件生态和系统架构上进行了全面升级。华为表示,该产品计划于2026年四季度正式上市,并可以通过多套超节点互联,进一步扩展至更大规模的算力集群。

这张图片清晰展示了昇腾950超节点的核心架构,包括其模块化设计、高密度计算单元以及强大的互联能力,直观呈现了这款产品的技术优势和规模特点。