曙光ParaStor接入Mooncake,商用分布式存储首入大模型推理核心
中科曙光旗下分布式存储产品ParaStor近日成为业界首家接入Mooncake社区的商用分布式存储,首次完成生产环境落地。该方案通过模块化改造提升容量弹性与稳定性,助力大模型推理场景实现16倍吞吐提升...
9月29日,中科曙光宣布其分布式存储产品ParaStor成功接入开源社区Mooncake,并在实际生产环境中完成部署。这一突破性进展使商用分布式存储首次进入大模型推理的核心业务链路,为解决AI训练中的KV Cache管理难题提供了全新解决方案。
在大模型推理过程中,Agent交互、高并发对话以及代码生成等场景会产生海量的KV Cache中间数据。传统内存方案成本高昂,本地SSD受限于单机容量和故障容错能力,而外置分布式存储则成为破解这一痛点的关键路径。然而,Mooncake原有外置存储接入能力在容量弹性扩展、数据恢复及异常场景稳定性等方面仍存在短板。
针对这些问题,曙光ParaStor团队对Mooncake DFS存储分配逻辑进行了模块化改造,重点优化了标准化接入、动态扩容和IO链路性能。通过联合SGLang构建的端到端测试环境验证,该方案在64K上下文、单卡7并发条件下实现了16倍吞吐提升,达到DRAM池吞吐值的80%,同时将平均首Token延迟和P90首Token延迟控制在10秒以内。
技术层面,曙光完成了Mooncake接口的标准化改造,无需修改上层程序即可快速适配通用文件访问。复杂架构改造被简化为轻量化开发,为更多商用存储接入大模型缓存场景铺平了道路。改造后的DFS接口支持缓存空间随业务负载按需扩容,实现以完整存储段为单元的冷数据回收,系统重启后缓存数据仍可恢复使用。

这一成果不仅降低了AI运行成本、提高了GPU利用率,更为国产全栈AI基础设施补上了关键一环。随着国产算力集群的密集落地,曙光ParaStor的成功接入为后续更大规模国产AI基础设施建设提供了可复制的工程样本。
值得注意的是,此次合作是国产存储厂商首次深度融入大模型推理核心业务链路。在当前AI算力需求持续增长的背景下,这一突破性进展标志着国产全栈AI基础设施建设迈出了重要一步,也为未来更大规模国产AI集群的建设奠定了坚实基础。
