华为推出OceanStorM900AI记忆存储,KVCache从临时缓存到长期资产
随着AI Agent和代码生成等场景对长上下文需求激增,传统三级缓存体系面临容量与成本瓶颈。华为近日发布OceanStor M900 AI记忆存储,将KV Cache从计算节点扩展至集群级共享存储,单...
在AI技术快速演进的背景下,KV Cache(Key-Value Cache)这一曾经被视为临时缓存的数据结构,正逐渐演变为需要长期保存、调度和复用的重要数据资产。特别是在Agent任务持续时间延长、AI Coding场景跨天跨周保留项目上下文的需求推动下,传统的显存、内存和本地SSD三级缓存体系在容量、成本和寿命方面开始触及瓶颈。
针对这一行业痛点,华为正式推出了OceanStor M900 AI记忆存储解决方案。这款产品并非简单的硬件升级,而是旨在将原本局限于显存和内存中的上下文记忆扩展出去,实现集群范围内的共享、保存和复用。华为分布式存储领域总裁杨文道表示,"M"代表Memory,其核心目标就是让Token对应的KV可以长期保存并重复命中,从而提升推理效率和降低成本。
从实际效果来看,通过专业KV Cache存储,可以让Token命中率提升约一倍,同时降低首Token时延(TTFT)。对于企业而言,这不仅直接影响用户体验,也直接关系到推理成本:如果历史上下文可以命中缓存,就不需要每次重新执行完整的Prefill过程。
当前,比较常见的推理缓存结构是L1位于显存,L2位于内存,L3位于本地SSD。显存和内存访问时延在纳秒级,但容量有限、成本较高;本地SSD容量更大,但访问时延已经进入毫秒级。随着长上下文和大规模Agent任务增加,仅靠这三层已经越来越难容纳不断膨胀的KV Cache。
华为的判断是,专业的KV上下文记忆存储并不是简单增加一个产品类别,而是可能成为大规模推理基础设施中新的固定层级。为此,华为在内部测试和客户POC中也遇到了新的挑战:如何在将KV Cache从显存和内存下沉到SSD的同时,解决随之而来的时延问题?
为了解决这一问题,华为在Mooncake推理框架基础上继续优化KV调度和预取机制。系统需要提前判断模型接下来可能使用哪些KV,并根据显存、内存和SSD不同介质的性能进行分层预取,在真正需要访问时尽量让数据已经进入更高速的上一层。同时,OceanStor M900 AI记忆存储还创新性地采用了一种"一跳直通"的设计,KV不再需要先转换成传统文件对象,而是直接按照KV语义进行处理,从而大幅减少数据搬运次数和协议转换开销。
数据显示,与业界普遍采用的PCIe+RoCE方案相比,华为的解决方案在数据搬运次数上减少了4次(从5次降至1次),存储读写寿命提升了16倍。这些改进使得OceanStor M900能够在保持高性能的同时,显著降低运营成本。
值得注意的是,华为的这一创新并非孤立的技术突破,而是对当前AI产业阶段的深刻洞察。当模型能力和算力逐渐趋同时,决定企业AI落地效率的关键因素正在从单纯的计算能力转向高质量的数据、足够的上下文记忆,以及能否以更低的成本反复利用这些记忆。
从行业趋势来看,KV Cache的规模增长已经成为不可逆的趋势。按照华为与客户的实际测算,如果真正按照生产要求保存大量上下文,最终需要的已经不是TB级,而是PB级存储。OceanStor M900的推出,正是为了应对这一未来需求,将超节点中的KV Cache从GB级提升到TB级,单集群可提供的存储容量达到64PB。
尽管华为在KV Cache存储领域的创新取得了显著成果,但这一领域的竞争才刚刚开始。其他厂商也在积极探索类似的解决方案,例如英特尔正在推进的KV Shrink方案,以及一些初创公司在分布式KV存储方面的探索。可以预见,在未来的AI基础设施建设中,KV Cache存储将成为一个关键的竞争维度。
