Kimi与DeepSeek同图架构解析,大模型Attention路线变迁

近期一张大模型架构图引发关注,其中同时出现了Kimi和DeepSeek的注意力机制设计。本文通过分析GLM-5.3-Flash项目配置文件,梳理了从全局注意力到稀疏注意力的技术演进路径,并探讨了不同模...

人工智能

在人工智能领域,大型语言模型(LLM)的架构设计一直是研究热点。最近,一张包含Kimi和DeepSeek注意力机制的大模型架构图在网络上引发讨论,这张图不仅展示了两家公司在技术路线上的交汇点,也反映了当前大模型架构设计中注意力机制的演变趋势。

根据GLM-5.3-Flash项目的配置文件显示,在45层架构中,34层采用了Kimi路线的KDA线性注意力,而另外11层则使用了DeepSeek路线的KPool-DSA稀疏注意力。这种混合架构的设计,直观地展现了当前大模型在处理长序列信息时,如何在计算效率和信息保留之间寻找平衡。

要理解这一现象,需要回到注意力机制的本质。目前常见的注意力机制主要分为三类:全局注意力(Full Attention)、线性注意力(Linear Attention)和稀疏注意力(Sparse Attention)。全局注意力能够直接访问完整的token历史,虽然信息保留最完整,但随着上下文长度增加,计算和缓存成本也会显著上升。线性注意力通过压缩历史信息来降低长序列的计算负担,而稀疏注意力则只关注部分重要信息,以达到更高的效率。

过去几年,为了应对大规模模型训练和推理的成本问题,许多研究者开始探索混合注意力架构。这种架构将不同类型的注意力机制组合在一起,让它们在模型的不同层级上分工协作。例如,Qwen3.8-Flash-Next就采用了每四层中三层为Gated DeltaNet(GDN),一层为Qwen Sparse Attention(QSA)的结构。这种设计既保留了全局注意力的精确性,又通过稀疏注意力机制降低了整体计算成本。

文章配图

值得注意的是,尽管混合注意力架构已经成为主流,但不同公司对注意力机制的选择仍然存在明显差异。以MiniMax为例,其架构经历了从线性注意力到混合注意力,再到最终转向稀疏注意力的演变过程。这反映出随着模型规模的扩大,不同注意力机制在实际应用中暴露出的问题也在不断变化。

Kimi和DeepSeek在这一架构中的并存,实际上反映了两种不同的技术路线:Kimi更倾向于线性注意力的高效压缩方案,而DeepSeek则坚持稀疏注意力的精准选择策略。这种技术路线的分化,不仅体现在具体实现细节上,也影响了各自模型在不同应用场景下的表现特点。

从技术演进的角度看,当前大模型架构正在经历从单一注意力路线向多组合架构的转变。这种转变的核心在于,如何在保证模型性能的同时,有效控制计算资源消耗。随着模型规模的持续扩大,单纯依赖某一种注意力机制已经难以满足需求,因此混合架构成为了新的发展方向。

未来,随着计算硬件的进步和算法优化,我们可能会看到更多创新的注意力机制出现。这些新机制可能会在效率和效果之间找到新的平衡点,进一步推动大模型技术的发展。