Kimi K3开源模型盲测登顶Code Arena
近日,Kimi K3开源模型在Arena AI的前端编程盲测中取得令人瞩目的成绩,以1679分高居榜首,超越了Claude Fable 5(1631分)和GPT-5.6 Sol(1618分)。这一结果...
近日,Kimi K3开源模型在Arena AI的前端编程盲测中取得令人瞩目的成绩,以1679分高居榜首,超越了Claude Fable 5(1631分)和GPT-5.6 Sol(1618分)。这一结果不仅展示了Kimi K3在视觉呈现和交互设计方面的卓越能力,也标志着开源模型在性能上首次全面超越闭源旗舰。
Code Arena榜单采用百万级用户参与的公开盲测机制,模型在完成任务后才揭晓身份,有效避免了品牌效应干扰。Kimi K3的表现尤其引人注目,其2.8万亿参数规模是目前全球首个开源的3万亿级别模型,远超此前由Kimi自身保持的开源模型参数上限。该模型不仅支持100万token上下文,还具备原生视觉理解能力,主要应用于长程编程、知识工作和复杂推理场景。
从技术架构来看,Kimi K3采用了两项创新:混合线性注意力(Kimi Delta Attention)和注意力残差(Attention Residuals)。前者解决了处理超长序列时的计算瓶颈问题,后者则确保信息在数百层深度网络中的准确传递。此外,K3还采用了MoE(专家混合)架构,896个专家中每次仅激活16个,配合优化的训练方法和数据配方,整体扩展效率相比前代提升了约2.5倍。
尽管官方承认K3在综合能力上仍略逊于Claude Fable 5和GPT-5.6 Sol,但在编程这一核心领域已展现出前沿水平。特斯拉CEO马斯克也在评论区留言称"Impressive"(令人印象深刻),进一步印证了K3的实力。
在成本控制方面,K3从预训练阶段就进行了量化感知训练,采用MXFP4权重和MXFP8激活格式,天生适配低精度硬件。其静态形状设计和关键路径优化减少了主机同步需求,同时将传统prefix caching挑战转化为对vLLM社区的贡献,随模型一同开源发布。
价格方面,K3的官方API输入和输出定价仅为Claude Fable 5的20%,Claude Opus 4.8的40%,显示出中国开源模型在性能对标的同时,正试图挑战Anthropic和OpenAI的价格体系。考虑到该模型将在10天后完全开源,有实力的企业可以自行部署,这无疑为开发者提供了更多选择。
图表显示,Kimi K3在Frontend Code Arena榜单中排名第一,得分1679分;在Artificial Analysis Intelligence Index中以57分位列第三,仅次于Fable 5和GPT-5.6 Sol;在多个编程评测基准(如DeepSWE、Terminal Bench 2.1等)中均表现出色,部分指标甚至超过GPT-5.6 Sol和Claude Fable 5。