PCIe显卡助力DeepSeek推理提速7倍,软件优化释放硬件潜能
是石科技通过Meta-Infer高效部署引擎,针对PCIe-only显卡进行内核补齐与通信重构,使DeepSeek模型在8张PCIe-only显卡环境下推理吞吐量提升近7倍。这一突破展示了软件优化在挖...
近日,是石科技(METASTONE)宣布其自主研发的Meta-Infer高效部署引擎,在DeepSeek大模型推理场景中取得重大突破。通过针对PCIe-only显卡的深度软件优化,DeepSeek模型的推理性能实现了近7倍的显著提升,为行业探索异构硬件的高效利用开辟了新路径。
在当前AI算力需求持续攀升的背景下,高性能GPU卡的采购成本和供给约束日益加剧。许多企业开始转向更务实的策略:如何最大化利用现有算力资源,而非单纯追求顶级硬件配置。然而,开源框架在适配非主流硬件时存在明显短板,导致大量硬件资源被闲置或低效利用。
是石科技的解决方案聚焦于两个核心优化方向:首先是算模协同阶段的内核补齐,通过修复硬件与框架之间的元数据差异、替换老旧计算内核,解锁原生高性能算子路径;其次是通算重构阶段的通信优化,包括扩大PCIe-IPC通信快路径覆盖范围、优化KV缓存处理逻辑等。以DeepSeek-V4.1-Flash为例,在8张PCIe-only显卡环境的社区Day0基线版本中,输入吞吐仅为1932 tok/s。经过Meta-Infer引擎的优化后,吞吐量直接提升至5850 tok/s,增幅达3倍以上。

"我们发现,很多高性能内核并非缺失,而是由于适配问题被静默绕开。"是石科技首席技术官表示,"通过精准的软件优化,可以充分释放硬件原本具备的算力潜力,让成本更低的PCIe-only显卡在特定推理任务中达到甚至超越高端GPU的表现。"
这一技术突破不仅对DeepSeek具有重要意义,也为整个AI推理领域提供了新的发展思路。在DeepSeek近期实现年化收入翻倍增长的同时,该优化方案有望帮助更多企业降低算力成本,提高资源利用率。随着DeepSeek计划在未来几个月内推出更多高性能模型,软件优化与硬件适配的协同效应将进一步显现。
业内人士认为,此次DeepSeek与是石科技的合作案例,标志着AI推理领域正在从单纯依赖硬件升级,转向更加注重软件优化与系统调优的新阶段。这将推动整个行业向更高效、更经济的方向发展。
