智谱GLM-5.3Flash两周提升3.2倍性能,国产芯片上AI自我优化首现

国内大模型公司智谱宣布其最新发布的GLM-5.3 Flash在两周内通过AI驱动的Infra Agent实现性能优化,将推理吞吐提升至3.2倍。该成果首次展示了AI在国产芯片集群上自我改进的能力,标志...

人工智能

9月17日,国内人工智能企业智谱(Zhipu AI)披露了一项重大技术进展:其新发布的大模型GLM-5.3 Flash在两周时间内实现了端到端吞吐量3.2倍的性能提升。这一成果不仅刷新了国产AI芯片的性能表现,更标志着AI系统首次在生产环境中实现自我优化。

此次优化的核心在于智谱团队开发的Infra Agent,一个由GLM-5.3驱动的自动化系统。该Agent负责设计、调试和优化GLM-5.3 Flash的推理基础设施,通过分析性能瓶颈并提出改进方案,成功解决了国产芯片显存容量、互联带宽等限制问题。数据显示,优化后的系统在超过10万张国产AI加速器组成的集群上运行,硬件利用率和单Token成本已接近主流英伟达GPU水平。

“这是AI参与整个推理系统工程闭环的重要一步。”智谱首席科学家唐杰表示,“我们看到了AI自我改进的早期迹象,它不仅能写代码,还能理解系统性能变化,并主动提出优化方案。”目前,GLM-5.3 Flash以匿名模型Ox-Alpha的身份在OpenCode和OpenRouter平台上线,6天内处理超过62万亿Token请求。

值得注意的是,这次优化并非简单的算力堆砌,而是通过一系列技术创新实现的。例如,采用ReplaySSM技术用计算换取内存空间,通过节点内张量并行降低显存压力,以及引入Encode-Prefill-Decode(EPD)分离式架构等。这些优化措施使得GLM-5.3 Flash在复杂多模态任务上的表现显著提升。

文章配图

智谱的这一突破不仅展示了国产AI芯片的潜力,也为未来大模型的发展指明了方向。唐杰透露,智谱正在研究下一代大模型GLM-6,目标是实现完全自训练和自我进化能力。他强调:“最大的挑战在于让模型能够自主判断何时停止、何时纠正自己,这需要解决模型自我评估和修正的核心难题。”

文章配图

业内专家认为,智谱的这项成果具有里程碑意义。它表明AI系统已经具备了参与复杂工程闭环的能力,而不仅仅是执行预设任务。随着技术的进一步发展,未来AI可能会在更多领域实现自我优化和进化,推动人工智能进入新的发展阶段。