华为集群战对标英伟达,昇腾960超节点成关键一步
华为通过推出昇腾960超节点、灵衢互联协议等系统级解决方案,以集群化方式应对与英伟达的技术差距。尽管单卡性能仍落后两代,但其系统集成能力正在构建新的算力竞争壁垒。
在人工智能芯片领域,华为正以一种不同于传统单卡直接对标的方式,向英伟达发起挑战。2026年全联接大会期间,华为发布的昇腾960超节点成为这场"集群战"的关键一环。这款产品不仅标志着华为在数据中心计算架构上的重大突破,也揭示了其绕开英伟达技术优势的独特策略。
从硬件层面看,昇腾960超节点采用NPO(光引擎)技术,单个节点最大支持4096张昇腾AI芯片,在FP8精度下理论峰值算力达到8 EFLOPS,并配备1PB高带宽内存。这种设计使得多个超节点可以进一步连接,组成包含约100万张计算卡的大型集群。值得注意的是,华为强调"百万卡"并非物理堆叠,而是通过系统级整合实现的逻辑集群效果。
"我们不追求单颗芯片的绝对领先,而是通过系统集成来弥补制程和单卡性能的差距。"一位华为内部人士表示。这种思路与英伟达传统的CMP(多芯粒异构封装)路线形成鲜明对比。英伟达的核心优势在于其强大的多线程协同能力,而华为则选择了DSA(面向特定领域优化的专用架构),将计算单元改造为三维立体的方块阵列,从而在每瓦功耗下获得更高的AI算力。
在软件生态方面,华为同样采取了差异化策略。虽然CANN社区月活跃开发者已超过5200名,外部占比达61%,但CUDA生态的惯性依然强大。为了降低模型迁移成本,华为开发了专门的工具链,将适配时间从原来的数月缩短至仅需1小时。然而,商业模型的迁移仍然需要较长周期,这成为其生态建设中的一个重要挑战。
当前,中国AI芯片市场的格局正在发生深刻变化。研究机构预测,到2026年,华为在中国市场的份额将达到50%,而英伟达则降至8%左右。不过,黄仁勋曾明确表示,英伟达在中国的实际市场份额已降至0%,这一现象背后更多是地缘政治因素而非单纯的技术竞争结果。
"集群规模扩大后,互联带宽、数据存储等环节都会影响算力利用率。"盘古智库高级研究员江瀚指出,"产业真正需要的是能够落地的有效算力,而不是纸面算力。"华为正是通过提升系统整体效率来解决这一问题,其Hi-ONE NPO光引擎技术可减少超过550千瓦的功耗,同时OceanStor M900 AI记忆存储则在容量、速度和成本之间找到了平衡点。
尽管面临诸多挑战,华为的系统级创新已经初见成效。根据内部测试数据,十万卡集群的实际模型算力利用率已经达到20%,远高于传统架构下的水平。这种通过系统集成提升有效算力的做法,正在成为AI算力竞争的新方向。