HBM与主机内存并发加速LLM推理,GeorgiaTech等三校联合突破

近日,Georgia Tech、Nvidia Research与Stanford大学联合发布技术论文《BOOST》,提出通过并发访问主机内存与HBM(高带宽内存)来提升大语言模型(LLM)推理性能的新...

人工智能

在人工智能领域,大语言模型(LLM)的计算需求持续攀升,这对存储系统提出了更高要求。近日,美国佐治亚理工学院(Georgia Tech)、英伟达研究部门(Nvidia Research)和斯坦福大学的研究团队联合发表了一项突破性研究成果,为解决这一难题提供了新思路。

这项名为"BOOST"的技术论文由Anish Saxena、Jae Hyung Ju等多位学者共同完成,发表于2026年9月。论文提出了一种全新的运行时系统,能够同时并行访问GPU的两种内存层级——主机内存和高带宽内存(HBM),从而充分利用两者带宽优势。研究人员发现,通过分析内核访问模式,可以实现页面分配和运行时数据管理的波形感知(wave-aware),有效消除访问比例波动。

具体而言,对于静态模型权重,BOOST采用模运算方式进行页面放置,消除了访问比例波动;而对于动态分配的注意力键值对(KV pairs),则使空闲KV页面池具有波形感知特性。实验结果显示,在相同的批次大小下,BOOST将Time-per-Output-Token(TPOT)指标提升了4.3%,而传统的预取机制反而导致TPOT下降了6%。在高吞吐量服务场景中,BOOST平均提升了31%的吞吐量,比预取机制高出15%。

文章配图

这项技术突破的意义在于,它无需修改现有内核代码即可实现性能提升,为当前主流的vLLM框架提供了即插即用的优化方案。研究人员表示,这种并发访问策略不仅适用于当前的HBM架构,也为未来更先进的存储技术提供了基础架构支持。

值得注意的是,尽管HBM已经广泛应用于高性能计算领域,但其容量和成本限制仍然存在。通过结合主机内存的低成本优势,BOOST系统能够在不增加额外硬件成本的情况下,显著提升LLM推理效率。这为数据中心运营商提供了更具性价比的解决方案,特别是在处理大规模语言模型时。

业界专家认为,这项技术的出现将推动AI计算架构的进一步发展。随着大语言模型规模的持续扩大,对存储带宽的需求也在不断增加。BOOST系统提供了一个创新的解决方案,既充分利用了现有硬件资源,又避免了高昂的硬件升级成本。预计在未来几年内,这项技术将逐步被主流AI框架和硬件厂商采纳,成为提升LLM推理性能的重要手段。