阿里云真武超节点适配KimiK3,国产算力突破万亿参数大模型瓶颈
在人工智能领域,超大规模模型的训练和推理对计算基础设施提出了前所未有的挑战。近日,阿里云与Kimi团队的合作成果引发了业界广泛关注:阿里云真武M890超节点实例已成功适配Kimi K3大模型,这是国内...
在人工智能领域,超大规模模型的训练和推理对计算基础设施提出了前所未有的挑战。近日,阿里云与Kimi团队的合作成果引发了业界广泛关注:阿里云真武M890超节点实例已成功适配Kimi K3大模型,这是国内首个跑通近3万亿参数模型的超节点。
Kimi K3作为目前业界参数规模最大的模型之一,总参数量达到2.8万亿,支持100万Token上下文,并具备原生多模态能力。然而,如此庞大的模型规模对芯片显存容量、节点间通信带宽和模型并行效率提出了极高要求。普通AI集群因通信带宽局限,无法满足高吞吐、低延迟、高并发的需求。
阿里云真武超节点的设计正是为了解决这一瓶颈。其核心芯片真武M890采用自研并行计算架构,内置144GB显存。磐久AL128超节点服务器基于自研AI芯片和互联芯片打造,单机柜128卡紧密耦合互联,P2P时延低于150纳秒。通过ICN Switch 1.0互联芯片,64张真武M890实现800GB/s高速互联,显存规模达9TB,单实例即可支撑大规模万亿级参数MoE模型部署。
为提升Kimi K3的运行效率,阿里云、平头哥与Kimi团队从软件栈、算子等层面进行了深度联合适配。例如,真武M890针对Kimi K3模型架构的核心算子进行了专项优化,显著提升了推理的算力和带宽利用率。实测数据显示,适配后模型首Token时延降低约35%,单卡解码吞吐提升1.8倍,可稳定支持百万级长上下文场景。
此次适配不仅意味着阿里云真武超节点能够支持当前主流的超大规模模型,更表明国产算力已具备支撑超大参数模型大规模应用的能力。阿里云表示,千问AI平台和阿里云百炼也将同步提供Kimi K3的模型API服务,实现深度协同。
随着国内外主流模型参数规模不断攀升,阿里云真武超节点的成功适配为AI产业提供了重要的基础设施保障。这一突破不仅展示了国产算力在高性能计算领域的技术实力,也为未来更大规模模型的研发和应用奠定了基础。