三大国产模型联手挑战复杂项目,Qwen3.8-Max表现最佳

近日,我们对国内三款顶级开源大模型——智谱GLM-5.2、Kimi K3以及阿里巴巴Qwen 3.8-Max进行了联合测试,旨在评估它们在处理复杂、历史遗留代码项目时的能力。此次测试的项目是一个正在改...

人工智能

近日,我们对国内三款顶级开源大模型——智谱GLM-5.2、Kimi K3以及阿里巴巴Qwen 3.8-Max进行了联合测试,旨在评估它们在处理复杂、历史遗留代码项目时的能力。此次测试的项目是一个正在改版的网站,该项目已经积累了大量的前端和后端代码,但由于长期缺乏系统性维护,代码结构混乱,功能冗余且存在大量未实现的需求文档,堪称典型的"屎山代码"。

面对这样一个充满挑战的项目,我们采用了"模型+opencode"的组合方式,让三个模型分别分析项目现状,并尝试解决实际问题。测试共分为两个主要环节:首先是让模型理解当前项目的进展和状态;其次是诊断并修复网站运行中出现的具体错误。

在第一个环节中,三个模型的表现差异显著。Qwen 3.8-Max以10秒内的速度快速完成了项目分析,准确抓住了项目近期的重点工作,包括前端页面的最新改动和CMS系统的运行状态。相比之下,GLM-5.2虽然对项目底层结构的理解最为深入,但过于依赖旧文档,将已完成的功能误判为待办事项。Kimi K3则介于两者之间,虽然能够快速给出全局概览,但在细节上出现了较多错误,如CMS集合数量统计不准确。

进入第二个环节,当网站因缺少CMS服务而出现报错时,三个模型的行动力也显现出不同特点。Qwen 3.8-Max不仅迅速定位问题,还直接启动了CMS服务,完美解决了报错。GLM-5.2虽然反应稍慢,但在发现端口被占用后,选择了复用已有服务,避免了冲突。而Kimi K3仅提供了理论上的解决方案,未能实际执行。

综合来看,Qwen 3.8-Max在本次测试中表现最为优异,无论是分析速度还是问题解决能力都领先于其他两款模型。这表明,尽管中国大模型在追赶国际顶尖水平时仍需时间,但在特定场景下,如代码理解和工程实践,已经展现出相当的实力。

图片

此次测试不仅展示了中国大模型在代码处理方面的潜力,也为未来的模型优化提供了方向。随着技术的不断进步,相信这些模型将在更多复杂的工程任务中发挥更大的作用。