网通社科技快报
阿里云发布新一代CPFS存储 吞吐量达百TB/s
在2026年云栖大会上,阿里云正式发布了新一代全栈自研高性能存储产品——CPFS(Cloud Parallel File Storage)。该存储系统专为下一代AI训练集群设计,旨在应对大模型训练中海量数据处理的挑战。新一代CPFS在性能上实现了突破性提升,吞吐量可达百TB/s级别,IOPS(每秒输入输出操作次数)达到亿级水平,单文件系统容量最大可扩展至100PiB,为未来更大规模的模型训练预留了发展空间。
在实际应用中,新一代CPFS带来了显著的性能提升和成本优化。数据显示,采用该存储方案后,模型启动平均耗时可降低50%,峰值算力利用率提升30%,业务承载能力翻倍。同时,通过智能生命周期管理和冷热分层存储技术,整体存储成本最高可降低69%。以Qwen大模型训练为例,使用新一代CPFS后,训练效率得到明显提升,资源利用率更高,成本也大幅下降。
针对大模型训练中海量小文件并发读取和Checkpoint突发写入等新瓶颈,新一代CPFS采用了数据服务与元数据服务分离架构。这种设计使得容量和性能可以实现水平扩展,GPU、CPU节点通过EFC弹性客户端和虚拟存储通道接入分布式元数据和数据服务。结合飞天盘古的分布式持久化存储底座和高性能存储网络,形成了从客户端、协议处理到数据落盘的全链路自研存储体系。
此外,阿里云还推出了KVCacheStore加速引擎,作为新一代存储体系的重要组成部分。该引擎位于GPU显存、主机内存与远端共享存储之间,通过近计算部署、高性能网络和弹性共享存储构建新型G3.5存储层。KVCacheStore支持与算力亲和部署,单计算节点吞吐达到40GB/s,通过Batch接口实现百万QPS,单实例可满足千亿级KV存储规模,实测缓存命中率提升20%以上。
阿里云存储产品负责人蒋江伟表示,新一代CPFS的发布标志着阿里云在AI存储领域的持续创新。通过算、网、存协同创新,阿里云致力于让数据更快进入计算,使GPU得到更充分利用,为大模型训练和AI应用提供高性能、可扩展且成本可持续优化的存储底座。
在实际应用中,新一代CPFS带来了显著的性能提升和成本优化。数据显示,采用该存储方案后,模型启动平均耗时可降低50%,峰值算力利用率提升30%,业务承载能力翻倍。同时,通过智能生命周期管理和冷热分层存储技术,整体存储成本最高可降低69%。以Qwen大模型训练为例,使用新一代CPFS后,训练效率得到明显提升,资源利用率更高,成本也大幅下降。
针对大模型训练中海量小文件并发读取和Checkpoint突发写入等新瓶颈,新一代CPFS采用了数据服务与元数据服务分离架构。这种设计使得容量和性能可以实现水平扩展,GPU、CPU节点通过EFC弹性客户端和虚拟存储通道接入分布式元数据和数据服务。结合飞天盘古的分布式持久化存储底座和高性能存储网络,形成了从客户端、协议处理到数据落盘的全链路自研存储体系。
此外,阿里云还推出了KVCacheStore加速引擎,作为新一代存储体系的重要组成部分。该引擎位于GPU显存、主机内存与远端共享存储之间,通过近计算部署、高性能网络和弹性共享存储构建新型G3.5存储层。KVCacheStore支持与算力亲和部署,单计算节点吞吐达到40GB/s,通过Batch接口实现百万QPS,单实例可满足千亿级KV存储规模,实测缓存命中率提升20%以上。
阿里云存储产品负责人蒋江伟表示,新一代CPFS的发布标志着阿里云在AI存储领域的持续创新。通过算、网、存协同创新,阿里云致力于让数据更快进入计算,使GPU得到更充分利用,为大模型训练和AI应用提供高性能、可扩展且成本可持续优化的存储底座。