Qwen3.8-27B本地推理提速至159tok/s,投机解码与引擎优化双突破

通过引入DFlash2草稿模型和LemonSeed Engine优化,Qwen3.8-27B在Sapphire Radeon AI PRO R9700上实现159 tok/s的本地推理速度。文章深入解...

人工智能

在本地运行大型语言模型进行代码辅助开发时,推理速度一直是制约体验的关键因素。近期,Qwen3.8-27B模型在特定硬件配置下实现了令人瞩目的性能提升,将本地推理速度从之前的14 tok/s大幅提高到159 tok/s,这一突破主要得益于投机解码(Speculative Decoding)技术和引擎层的系统优化。

投机解码:从14 tok/s到159 tok/s的技术跃迁

传统的自回归解码受限于内存带宽,每次生成都需要完整搬运全部模型权重,导致推理延迟难以降低。而Qwen3.8-27B团队采用的投机解码机制,通过引入Q8精度的DFlash2小模型作为草稿预测器,再由主模型并行验证候选词树,成功将原本受内存带宽约束的串行解码转化为受计算单元约束的并行验证。这种创新方法使得在Sapphire Radeon AI PRO R9700上,Qwen3.8-27B的代码提示解码速度达到了159.4 tok/s,相比原生基准提升了近10倍。

引擎级优化:算子融合与架构适配

除了投机解码,LemonSeed Engine 0.5.8版本的引擎级优化也起到了关键作用。该引擎默认开启了草稿树验证功能,并针对Sapphire Radeon AI PRO R9700的gfx1151架构实现了gate/up GEMM算子融合,配合预填注意力阶段的双查询瓦片(Dual-Query Tiling)优化,使得在macOS环境下4K上下文预填速度达到1,634 tok/s,即便扩展到32K长上下文,预填速度依然保持在1,401 tok/s。

不同硬件平台表现对比

为了全面评估这一优化方案的效果,测试团队在多种硬件平台上进行了实测对比。结果显示,在配备Sapphire Radeon AI PRO R9700的macOS环境下,Qwen3.8-27B的解码速度达到159.4 tok/s;而在Linux环境下,相同配置的解码速度为144.6 tok/s。相比之下,搭载Strix Halo (Radeon 8060S)的Linux系统仅能达到64.4 tok/s,而使用Mac Studio M3 Ultra搭配Ollama原生Qwen3.8-27B Q4_K_M的配置,解码速度仅为14.0 tok/s。

文章配图

硬件选型与成本考量

尽管159 tok/s的解码速度令人印象深刻,但开发者在选择硬件配置时仍需综合考虑成本与实际需求。对于需要快速代码补全和实时交互的开发者来说,投资于专业显卡如Sapphire Radeon AI PRO R9700可能是值得的。然而,对于预算有限或对性能要求不那么苛刻的用户,现有的消费级硬件也可能满足基本需求,只是需要接受稍慢的响应速度。

结语

Qwen3.8-27B在本地推理速度上的显著提升,不仅展示了投机解码和引擎优化技术的巨大潜力,也为开发者提供了更多选择本地AI编程环境的可能性。随着技术的不断进步,未来我们有望看到更多类似的性能突破,让本地AI应用真正成为高效开发的得力助手。