网通社科技快报
曙光8000十万卡AI超算落地 全国产浸没液冷突破散热极限
2026年7月,由中科曙光自主研发的曙光8000(登峰)AI超算集群正式投入使用,标志着中国首个全国产化、具备十万卡规模的AI超算系统成功落地。该集群搭载国产智算芯片、scaleFabric高速网络与高性能分布式存储,通过创新的浸没式相变液冷方案,有效解决了超大规模AI集群面临的散热挑战。
随着AI加速卡规模扩展至十万卡级别,芯片功率密度显著提升,传统风冷和冷板散热方式已接近物理极限。曙光8000采用的浸没式相变液冷技术,将计算卡、主板等核心元器件整体浸泡在绝缘冷却液中,依靠介质受热沸腾相变快速带走热量,形成闭环循环换热系统。相比传统风冷,该方案散热密度显著提升,同时可压缩机房占地面积,整机能耗降低约40%,集群PUE(能源使用效率)可低至1.04。
曙光8000实现了芯片、计算、存储、高速网络全链路国产自主可控,采用超智融合架构,既能满足AI大模型训练推理需求,又能支持高精度科学计算任务。其搭载的自研scaleFabric高速网络与高性能分布式存储,确保十万卡规模下的大规模并行通信效率,适用于新材料研发、生物医药仿真、气象预测等AI for Science领域。
经过六年攻关,曙光8000项目投入数千人研发力量,攻克了从芯片设计到整机制造的多项核心技术。其计算单元内部密集排布着两三万个器件,模块对接误差需控制在0.2毫米以内。研发团队借鉴古建筑斗拱结构设计理念,探索高密度模块的结构优化,并由此构建起超集群的体系基础。
在网络层面,曙光8000通过自主交换芯片实现毫秒级故障恢复,将局部传输故障的影响降至最低;在存储方面,建立了从网卡到硬盘的数据专属通道,形成十亿量级的“超级隧道”;在散热领域,则采用金刚石铜材料,并将散热器直接焊接在芯片裸片上,攻克了材料与工艺难题。
这些关键技术环环相扣,共同构成了曙光8000强大的系统工程能力。目前,该系统已在多个领域得到实际应用,例如中国气象局地球系统数值预报中心依托该系统,实现了全球5公里分辨率、未来10天的气象预报计算,展现了国产算力支撑高分辨率数值预报的能力。
曙光8000的成功落地,是中国算力基础设施建设的重要里程碑。它证明了自研浸没相变液冷技术可以支撑十万卡级超大规模智算工程,为后续更大规模国产算力集群建设提供了可复制的工程样本。在当前算力需求持续暴涨的背景下,液冷技术已成为国产超大规模AI集群规模化落地的基础设施底座。随着更多类似项目的落地,中国在全球算力竞争中的地位将进一步巩固。
随着AI加速卡规模扩展至十万卡级别,芯片功率密度显著提升,传统风冷和冷板散热方式已接近物理极限。曙光8000采用的浸没式相变液冷技术,将计算卡、主板等核心元器件整体浸泡在绝缘冷却液中,依靠介质受热沸腾相变快速带走热量,形成闭环循环换热系统。相比传统风冷,该方案散热密度显著提升,同时可压缩机房占地面积,整机能耗降低约40%,集群PUE(能源使用效率)可低至1.04。
曙光8000实现了芯片、计算、存储、高速网络全链路国产自主可控,采用超智融合架构,既能满足AI大模型训练推理需求,又能支持高精度科学计算任务。其搭载的自研scaleFabric高速网络与高性能分布式存储,确保十万卡规模下的大规模并行通信效率,适用于新材料研发、生物医药仿真、气象预测等AI for Science领域。
经过六年攻关,曙光8000项目投入数千人研发力量,攻克了从芯片设计到整机制造的多项核心技术。其计算单元内部密集排布着两三万个器件,模块对接误差需控制在0.2毫米以内。研发团队借鉴古建筑斗拱结构设计理念,探索高密度模块的结构优化,并由此构建起超集群的体系基础。
在网络层面,曙光8000通过自主交换芯片实现毫秒级故障恢复,将局部传输故障的影响降至最低;在存储方面,建立了从网卡到硬盘的数据专属通道,形成十亿量级的“超级隧道”;在散热领域,则采用金刚石铜材料,并将散热器直接焊接在芯片裸片上,攻克了材料与工艺难题。
这些关键技术环环相扣,共同构成了曙光8000强大的系统工程能力。目前,该系统已在多个领域得到实际应用,例如中国气象局地球系统数值预报中心依托该系统,实现了全球5公里分辨率、未来10天的气象预报计算,展现了国产算力支撑高分辨率数值预报的能力。
曙光8000的成功落地,是中国算力基础设施建设的重要里程碑。它证明了自研浸没相变液冷技术可以支撑十万卡级超大规模智算工程,为后续更大规模国产算力集群建设提供了可复制的工程样本。在当前算力需求持续暴涨的背景下,液冷技术已成为国产超大规模AI集群规模化落地的基础设施底座。随着更多类似项目的落地,中国在全球算力竞争中的地位将进一步巩固。