谷歌TPU跑Kimi快57%!DeepSeek框架助力性能跃升
谷歌TPU在运行Kimi模型时,相比英伟达GB200 GPU性能提升57%,达到709 tokens/秒。这一突破得益于DeepSeek推理框架的优化,通过内核补齐和通信重构等技术手段,显著提升了硬件...
近日,谷歌TPU在运行Kimi模型时展现出显著的性能优势,其吞吐量达到709 tokens/秒,相比英伟达GB200 GPU的452 tokens/秒提升了57%。这一性能对比图表清晰地展示了TPU在特定场景下的优越性,为AI推理硬件的选择提供了新的参考维度。
在AI大模型快速发展的背景下,硬件性能与软件优化的适配问题日益凸显。许多GPU卡虽然能够完成模型加载和基本推理任务,但在实际压测中往往无法达到官方宣传的性能水平。这种性能鸿沟主要源于模型框架与硬件之间的适配问题,导致高性能算子无法被有效触发,通信路径存在瓶颈,显存利用率不足等问题。

为解决这一行业痛点,是石科技(METASTONE)自主研发了Meta-Infer高效推理引擎。该引擎通过两大关键技术实现性能提升:首先是算模协同阶段的内核补齐,通过对硬件与框架元数据的对齐、页尺寸配置的修正以及通信路径的优化,解锁了原本被屏蔽的高性能算子路径;其次是通算重构阶段的通信重构,通过扩大PCIe-IPC通信快路径覆盖范围,显著提升了大规模通信任务的处理效率。
以DeepSeek-V4.1-Flash模型为例,在8张PCIe-only显卡环境下,经过Meta-Infer引擎优化后,输入吞吐从1932 tok/s提升至5850 tok/s。这一性能提升并非依赖全新算法,而是通过软件优化手段,充分挖掘了现有硬件的潜在能力。同样的优化策略也成功应用于DeepSeek-V4-Flash和GLM5.3等模型,展现了该技术方案的普适性和有效性。
值得注意的是,Meta-Infer引擎的优化效果不仅限于特定硬件平台。通过软件层面的适配修复,成本更低的GPU卡有机会在部分推理业务指标上逼近高端GPU的表现,为AI推理资源的高效利用提供了新的可能性。这一技术突破对于降低AI推理成本、提升算力利用率具有重要意义,也为未来AI硬件与软件的协同发展指明了方向。
