AI数据中心电力囤积难题,从芯片到系统全栈优化成解题关键

AI数据中心面临电力利用率低、资源闲置的困境。专家指出,单纯增加电力供应无法解决瓶颈,需通过芯片设计、网络架构和供电系统的全栈协同优化,提升计算资源的实际使用效率。

人工智能

近年来,随着人工智能技术的快速发展,AI数据中心已成为全球能源消耗的重要来源之一。然而,这些数据中心在电力利用方面却面临着一个棘手的问题:尽管提供了远超实际需求的电力储备,但大量计算资源仍处于闲置状态,导致能源浪费严重。

"Idle power is by far the biggest sink of power in systems," said Arif Khan, vice president of product marketing for design IP at Cadence。他指出,部分服务器运行电压高于必要水平,同时为应对突发情况预留了过多的电力储备,这直接导致了能源的浪费。

Steven Woo,Rambus的资深研究员和发明家也表示:"Customers are talking about this more openly now, especially in large data centers where small inefficiencies add up fast." 他进一步解释说,由于工作负载对资源的需求波动较大,有时会出现资源过度配置的情况,从而造成所谓的"stranded power"(搁浅电力)。

微软Azure硬件系统与基础设施总裁Rani Borkar对此问题进行了深入分析。她强调,存储和电力已经成为比计算芯片更难以绕开的硬性限制因素。Borkar指出,当前许多AI系统由多层架构组成,受限于数据传输延迟与带宽限制,系统往往仅能发挥约20%的实际性能。

为解决这一问题,Borkar提出了"从芯片到系统"的跨层协同设计思路。具体措施包括:采用台积电3nm工艺制造的Maia 200 AI加速器,搭载216GB HBM3e高带宽内存;通过模型压缩、数据科学与架构设计降低KV Cache需求;采用双层Scale-up网络架构,将网络接口控制器直接整合进芯片;导入固态变压器与800V直流供电架构,并将精细电压与时钟控制器直接整合至Cobalt 200的每个核心内。

这些创新举措旨在实现"有效产出"的新指标,即在相同存储容量与电力条件下,让更多的计算资源持续工作并产出更多token。Borkar强调,没有任何一项创新能单独消除瓶颈,但放在一起就能大幅提高相同存储资源所交付的成果。

文章配图

"AI的实际性能往往只有20%,"Borkar补充道,"这意味着我们还有很多可以改进的空间。通过全栈优化,我们可以显著提高数据中心的能源利用效率,减少不必要的电力浪费。"

这项研究不仅对AI数据中心的运营具有重要意义,也为整个科技行业提供了新的思考方向。未来,随着技术的不断进步,我们有望看到更加高效、节能的AI基础设施解决方案出现。