DeepSeekV4.1-Flash如何将KVCache压缩至890字节/token

DeepSeek 发布 V4.1-Flash 模型,通过架构优化和存储调度,将全局 KV 缓存从 3514 字节/token 压缩至 890 字节/token,持久化 KV 减少至约 1/8。本文详解...

人工智能

在长上下文大模型部署中,KV Cache 的存储和传输成本一直是核心挑战之一。近日,DeepSeek 推出的 V4.1-Flash 模型通过一系列技术创新,将全局 KV 缓存压缩至 890 字节/token,持久化 KV 减少至约 1/8,同时支持 1M 上下文长度。这一突破不仅显著降低了显存占用,也为长程 Agent 应用提供了更经济的部署方案。

长上下文场景下的 KV Cache 瓶颈

标准 Decoder-only Transformer 在处理长上下文时面临两大成本:Prefill 阶段的计算量(随序列长度线性增长)和 Decode 阶段的 KV 缓存存储与传输开销。随着上下文长度从 4K 增加到 1M,KV 缓存的存储需求呈指数级增长,成为性能瓶颈的主要来源。

DeepSeek V4.1-Flash 的技术报告指出,通过以下三项关键改进,成功将 KV 缓存压缩至 890 字节/token:

  • 全局 KV 的架构优化,采用 CSA2 和 FP4 压缩技术,将容量压缩至原来的 1/4;
  • SWA KV 不再持久化,改为主机内存专用池复用;
  • 存储调度层面的优化,使整体持久化 KV 减少至约 1/8。
  • KV Cache 压缩对比图

    技术细节解析

    V4.1-Flash 的 KV 压缩主要集中在全局注意力分支(global attention),这部分占用了大部分显存。通过 CSA2(Compressed Sparse Attention)和 FP4(4-bit Floating Point)技术,DeepSeek 将每 token 的全局 KV 体积压缩至 890 字节。值得注意的是,这一数字仅针对全局 KV,不包含 SWA KV、Engram 参数、激活值或模型权重。

    此外,V4.1-Flash 还引入了三级存储策略:HBM(显存)、主机内存和 SSD。其中,SWA KV 被移出持久化层,改为在活跃会话的分钟级窗口内复用,既提高了效率又避免了资源浪费。

    对长上下文 Agent 的影响

    长上下文 Agent 场景的特点是任务复杂度高、工具调用频繁,上下文长度可达数十万 token。V4.1-Flash 的 KV 压缩技术显著降低了这类场景的部署成本,使得单 token 解码 FLOPs 只增加约 25%,而上下文长度却提升了 256 倍。

    然而,技术报告也指出,尽管 KV 压缩效果显著,但解码计算量并未减少,持久化 KV 的重建仍为近似算法,且缓存恢复边界需要更多压力测试。这些未完全解决的问题提醒开发者,在选择是否升级至 V4.1-Flash 时,需根据具体应用场景权衡利弊。

    行业意义与未来展望

    DeepSeek V4.1-Flash 的 KV 压缩技术为长上下文大模型的部署提供了新的思路。通过架构优化和存储调度的结合,不仅降低了硬件成本,还提高了模型的可用性。这一技术突破可能推动更多企业采用长上下文模型,特别是在需要处理海量数据的场景中。

    未来,随着技术的进一步成熟,KV 压缩技术有望在更多模型中得到应用,从而推动整个 AI 行业向更高效、更经济的方向发展。