AI数据中心网络瓶颈凸显,十万卡集群带宽利用率仅38%
过去几年,人们习惯用单颗GPU的算力指标衡量AI基础设施先进程度。然而,2026年这一逻辑已被改写:当大模型训练集群规模从千卡迈向万卡甚至十万卡时,真正的瓶颈已不再是芯片算力,而是网络通信能力。 ![...
过去几年,人们习惯用单颗GPU的算力指标衡量AI基础设施先进程度。然而,2026年这一逻辑已被改写:当大模型训练集群规模从千卡迈向万卡甚至十万卡时,真正的瓶颈已不再是芯片算力,而是网络通信能力。
以计算机视觉模型训练为例,是德科技网络与数据中心副总裁Joachim Peerlings在Keysight World大会上展示的数据令人深思:GPU有超过60%的时间花费在数据移动和通信上,真正用于计算的时间仅占20%左右。这意味着昂贵的GPU大部分时间处于"等待"状态,而非"运算"状态。
更严峻的是,在资源密集的大语言模型训练任务中,因网络问题导致的训练失败率高达21%。每五次训练就有一次因网络中断而失败,而一次中断可能意味着数小时甚至数天的计算成果付诸东流。
中科曙光高级副总裁李斌指出,传统CPU计算节点一台机器配一张网卡即可,但如今以GPU为中心的计算节点,一台机器需要配置八张甚至更多网卡,数据中心高速网络用量相比原来提升了10到20倍。
面对上万张GPU同时协同工作的场景,任何一个节点的网络抖动、拥塞或丢包,都可能导致成百上千张卡进入等待状态。当前AI大模型训练集群的单端口流量已逼近400G,但传统网络的负载均衡算法依然停留在"逐流ECMP"时代,这种模式将每一条数据流通过哈希算法分配到某一条链路上。然而,AI训练的流量模式需要成千上万个GPU同时发起通信,流量像潮水一样涌来,哈希算法根本来不及反应,结果就是部分端口满载,部分端口闲置的资源错配。
相比之下,新的端到端负载均衡方法可将网络带宽利用率提升最高38%,模型训练任务时长缩短超过3%。在十万卡集群中,3%的训练加速可能意味着节省数百万美元的电力成本和数周的研发周期。
造成这一困境的根本原因在于,芯片算力的增长速度远远超过了数据在芯片之间搬运的速度。这使得网络已成为制约AI集群发展的核心因素。
面对这样的矛盾,行业最初的选择是堆硬件:更高速的光模块、更大端口的交换机、更粗的铜缆。从400G到800G再到1.6T,接口速率每隔一两年就翻一倍。然而,这条看似直接的路径正越走越窄。
是德科技网络应用安全部门技术经理杨益锋表示,当前带宽翻倍的速度远不及模型规模翻倍的速度。一个典型的大语言模型,参数量从千亿级到万亿级只用了不到两年,而光模块从400G迭代到800G再迭代到1.6T,每一次跃进背后都是漫长的产业链协同。更重要的是,带宽翻倍带来的成本、功耗和散热压力呈指数级增长,到了某个临界点之后,每提升1G带宽所付出的代价会让任何财务总监都皱眉头。
与此同时,单纯堆硬件也带来了ROI问题。不少企业在落地AI网络时,都踩过同一个坑:为了提升带宽购买了一批最先进的高速交换机和高性能光模块,设备采购花了几个亿,实际运行时发现三分之一的算力都损耗在网络等待上,相当于每三台GPU就有一台在空转。
究其原因,AI网络的性能瓶颈往往不在设备本身的标称规格上,而在于流量调度机制的精细度。即使把带宽修到400G、800G,但如果流量调度依然靠"蛮力",大部分带宽依旧是被浪费的。
正是在这个背景下,行业开始从堆硬件转向了如何通过协议、软件等方式,让数据流跑得更顺畅。传统的TCP/IP网络是为人与人通信设计的,比如网页请求、邮件发送、文件下载,这些场景中流量随机且不着急,丢几个包大不了重传。但AI网络完全不同,GPU集群内部通信是"机器与机器"的对话,周期性极强、同步要求极高。在大规模模型训练中,所有GPU必须在一个同步周期内完成全部梯度交换,任何一个慢节点都会拖垮整个集群。这就形成了"木桶效应",在AI网络里,一个微小的网络抖动,就是那块最短的板。
在此背景下,LLR与CBFC这两个原本并不受关注的技术开始被AIDC运营方关注。其中,LLR把重传机制下沉到链路层,让交换机自己发现丢包、自己重传,把恢复时间从毫秒压到微秒级,解决了传统IDC网络中因一个数据包丢失引发的重传延迟。CBFC则可以理解为是一个"网络红绿灯"系统,发送端在发数据之前,先确认接收端有足够的