AI存储新突破,焱融F9000X集群实现KVCache跨节点共享

在MLPerf Storage v3.0评测中,焱融科技F9000X三节点集群凭借544GiB/s聚合带宽刷新训练数据供给记录,并在Checkpoint测试中取得双项第一。该系统通过ContextBo...

人工智能

近日,在MLPerf Storage v3.0权威基准评测中,焱融科技(Fanru Technology)推出的F9000X三节点全闪存存储集群表现亮眼,不仅在3D U-Net训练数据供给测试中实现544GiB/s的聚合带宽,刷新世界纪录,还在Checkpoint 70B测试中取得读写带宽双项第一。这一成绩不仅展示了其卓越的数据通路能力,更标志着AI存储技术正从单纯的数据供给向推理过程中的状态管理演进。

与传统AI存储主要服务于计算开始前的数据供给不同,MLPerf Storage v3.0新增的KVCache测试项要求存储系统处理推理过程中产生的运行时状态。这意味着存储不仅要满足高带宽、高并发和低延迟的基本性能要求,还要解决推理阶段特有的缓存复用问题。焱融科技从训练存储起步,先后推出AI原生推理存储系统YRCache和共享缓存一体机ContextBox,为观察这一技术演进提供了典型案例。

在推理过程中,大模型需要逐Token生成答案,长文档或复杂提示词会导致预填充阶段消耗大量算力和时间。通过保留已计算的Key和Value(KV Cache),可以避免重复计算上下文,但要实现跨请求的全局复用,面临三大核心挑战:首先是内容匹配问题,即使是相同文本,因系统提示词微调或Token序列差异,缓存也无法通用;其次是显存容量限制,未即时命中的缓存可能被换出至主机内存或本地SSD,增加二次加载开销;最后是节点孤立问题,首个请求由A节点生成的缓存无法被调度至B节点使用,导致重复计算。

焱融科技通过ContextBox实现了KV Cache的跨节点共享。在单机架构中,采用G1~G3三级分层存储:G1为GPU HBM显存,G2为主机内存,G3为本地SSD。通过内存配额、资源隔离和多盘NVMe聚合,确保低延迟的同时实现高效缓存调度。但在集群环境中,仅靠单机本地SSD无法解决跨节点共享问题,必须构建专用的低延迟传输通路。

文章配图

图1展示了F9000X在3D U-Net训练数据供给和Checkpoint 70B读写性能方面的优异表现,红色柱状图代表F9000X的成绩,明显优于其他厂商。图2则清晰呈现了多节点AI计算集群与存储集群的互联架构,通过NVIDIA QM9700 400Gbps InfiniBand交换机实现高速数据传输。

图3详细展示了AI推理异构缓存分层架构(G1~G3.5),其中G1为GPU HBM显存,G2为主机内存,G3为本地SSD。通过YRCache ContextBox,实现KV Cache的卸载、弹性扩展和跨节点共享,支持长上下文、高并发和Agent推理等场景。

这一技术突破不仅提升了推理效率,降低了响应延迟,也为AI存储从训练向推理的全面演进奠定了基础。随着AI应用的深入,存储系统需要同时承载传统业务的稳定性和AI业务的高性能需求,焱融科技的解决方案为此提供了重要参考。