KVCache4bit量化落地,SGLang在Blackwell上实现1.78倍上下文与+78%解码

SGLang团队联合阿里云Qwen与NVIDIA,在Blackwell平台实现KV Cache从FP8到NVFP4(4bit浮点)的量化,显著提升长上下文处理能力。该技术通过三级缩放、内核反量化和分页...

人工智能

近日,SGLang官方博客公布了其在NVIDIA Blackwell平台上的KV Cache量化成果:通过将KV Cache从FP8压缩至NVFP4(4bit浮点),在Qwen3.5-397B-A17B模型上实现了显著性能提升。具体表现为每个token的KV显存降至FP8的约56%,同样显存下可容纳约1.78倍的上下文;解码吞吐在32K、160K、1M三种上下文长度下分别提升37%、58%和78%。

这一突破的核心在于解决了长上下文推理中的显存瓶颈问题。全注意力模型推理时,显存占用主要分为三部分:模型权重、KV Cache以及运行时开销。其中,KV Cache的规模与序列长度和批大小呈线性关系,是限制长上下文可用性的关键因素。以397B-A17B模型为例,在FP8下单条100万token序列的KV Cache已达到几十GB量级,而将每元素字节数降至0.5后,同一张卡能同时服务的请求数或单请求容纳的上下文长度都将提升一档。

文章配图

为实现这一量化目标,研究团队提出了三项关键技术:首先采用两级缩放(block级与张量级scale)解决4bit浮点动态范围狭窄的问题;其次在解码期kernel内实现反量化,避免额外内存往返开销;最后通过分页KV Cache管理变长序列与高并发场景下的碎片问题。这些技术共同确保了精度近乎无损的同时,实现了显存与带宽的有效节省。

值得注意的是,该技术的收益随上下文长度增加而递增。对于短上下文(如8K-16K),由于KV Cache占总显存比例较小,量化带来的收益有限;而对于长上下文(如1M),则能接近翻倍的解码吞吐提升。这表明量化主要节省的是显存带宽而非计算量,因为解码阶段本质上是memory-bound操作,每次生成token都需要读取整份KV Cache。

此外,该技术还具有重要的规模化意义。通过分页KV Cache管理,即使在4bit下也能有效应对变长序列与高并发场景,解决了传统方法中页表项密度与管理开销敏感的问题。这一突破不仅提升了单卡处理长上下文的能力,也为未来更大规模模型的部署提供了新的可能性。