阿里云发布新一代CPFS存储,百万卡训练提速50%、成本降69%

在2026云栖大会上,阿里云正式推出新一代全栈自研高性能存储CPFS。该存储系统可提供百TB/s级吞吐和亿级IOPS,单文件系统规模达100PiB,显著提升大模型训练效率,将模型启动耗时降低50%,峰...

互联网/IT

9月22日,在2026年云栖大会上,阿里云重磅发布了面向下一代AI训练集群的新一代高性能存储产品——CPFS(Cloud Parallel File Storage)。这一全栈自研的存储解决方案,旨在应对大模型训练规模化带来的数据处理挑战,为百万卡级别的模型训练提供强有力支持。

据阿里云介绍,新一代CPFS在性能上实现了突破性提升。其吞吐量可达百TB/s级别,IOPS(每秒输入输出操作次数)达到亿级水平,单文件系统容量最大可扩展至100PiB。这些指标不仅满足了当前大模型训练的需求,也为未来更大规模的模型训练预留了发展空间。

在实际应用中,新一代CPFS带来了显著的性能提升和成本优化。数据显示,采用该存储方案后,模型启动平均耗时可降低50%,峰值算力利用率提升30%,业务承载能力翻倍。同时,通过智能生命周期管理和冷热分层存储技术,整体存储成本最高可降低69%。以Qwen大模型训练为例,使用新一代CPFS后,训练效率得到明显提升,资源利用率更高,成本也大幅下降。

针对大模型训练中海量小文件并发读取和Checkpoint突发写入等新瓶颈,新一代CPFS采用了数据服务与元数据服务分离架构。这种设计使得容量和性能可以实现水平扩展,GPU、CPU节点通过EFC弹性客户端和虚拟存储通道接入分布式元数据和数据服务。结合飞天盘古的分布式持久化存储底座和高性能存储网络,形成了从客户端、协议处理到数据落盘的全链路自研存储体系。

KVCacheStore技术架构

此外,阿里云还推出了KVCacheStore加速引擎,作为新一代存储体系的重要组成部分。该引擎位于GPU显存、主机内存与远端共享存储之间,通过近计算部署、高性能网络和弹性共享存储构建新型G3.5存储层。KVCacheStore支持与算力亲和部署,单计算节点吞吐达到40GB/s,通过Batch接口实现百万QPS,单实例可满足千亿级KV存储规模,实测缓存命中率提升20%以上。

“每一次模型的跃迁,都是云存储自我革新的最佳契机。”阿里云存储产品负责人蒋江伟表示,新一代CPFS的发布标志着阿里云在AI存储领域的持续创新。通过算、网、存协同创新,阿里云致力于让数据更快进入计算,使GPU得到更充分利用,为大模型训练和AI应用提供高性能、可扩展且成本可持续优化的存储底座。