GLM-5.3实测登顶,国产编程模型再迎重大升级

在当前大模型竞争白热化的背景下,国产编程模型GLM-5.3的发布再次引发行业关注。这款由智谱AI推出的最新版本,在多个权威基准测试中表现出色,特别是在编程能力方面与国际顶尖模型并驾齐驱。 根据公开的评...

人工智能

在当前大模型竞争白热化的背景下,国产编程模型GLM-5.3的发布再次引发行业关注。这款由智谱AI推出的最新版本,在多个权威基准测试中表现出色,特别是在编程能力方面与国际顶尖模型并驾齐驱。

根据公开的评测数据,GLM-5.3在Terminal Bench、DeepSWE等多个编程相关测试中均取得了领先成绩。其中在Terminal Bench 3.0测试中,GLM-5.3以28.3分的成绩位居榜首,远超Kimi K3的4.6分和DeepSeek V4 Pro的17.4分。而在DeepSWE测试中,GLM-5.3更是以66.9分的高分碾压竞争对手,显示出其在代码生成和理解方面的强大实力。

图片

值得注意的是,尽管参数规模与上一代GLM-5.2保持一致(约7000亿参数),但GLM-5.3通过后训练技术实现了显著的性能提升。这种技术路径的选择,反映了当前大模型发展的一个重要趋势:相较于单纯增加参数规模,通过精细化的后训练优化可以获得更明显的性能改进。

图片

除了编程能力的提升,GLM-5.3在网络安全领域的表现同样引人注目。在ExploitGym测试中,该模型成功完成了105道题目中的130题,这一成绩甚至超过了部分商业模型的表现。智谱AI还公开了其网络安全披露账本,记录了模型发现的各种漏洞,其中包括一些可以追溯到40年前的历史漏洞。

图片

为了支持模型的持续优化,智谱AI还开源了名为Slime的后训练框架。该框架能够覆盖从预训练到微调的完整工作流,目前已支持包括GLM系列、Qwen系列以及DeepSeek系列在内的多个模型家族。这一举措不仅有助于推动整个行业的技术进步,也为其他开发者提供了重要的参考工具。

目前,GLM-5.3已经上线智谱官方的Zcode应用和AutoClaw效率工具,并面向GLM Coding Plan用户全面开放。随着更多应用场景的落地,这款模型有望在实际开发工作中发挥更大作用。