Step5Preview实测,和DeepSeekV4Pro、GLM5.3谁更适合做复杂Agent任务
本文通过实际测试,对比了 Step 5 Preview、DeepSeek V4 Pro 和 GLM5.3 在完成一个 3D Minecraft 小游戏项目中的表现。测试重点在于模型的自动代码生成能力、...
近日,一款名为 Step 5 Preview 的国产大模型在真实 Agent 任务中进行了实测,其表现引发了广泛关注。该模型由 WorkBuddy 团队开发,定位为面向复杂任务的旗舰级模型,尤其擅长软件工程和专业知识工作领域。为了验证其性能,作者将其与 DeepSeek V4 Pro 和 GLM5.3 进行了对比测试,核心任务是使用 WorkBuddy 工具从零开始制作一个功能完整的 3D Minecraft 小游戏。
这次测试的核心在于评估模型在真实 Agent 任务中的综合能力,包括代码生成、环境检测、问题修复以及最终交付质量。与传统的 Benchmark 测试不同,本次测试没有提供具体的技术方案或项目结构指导,而是完全依赖模型自主理解任务并执行。这种测试方式能够更真实地反映模型在复杂任务中的表现差异。
首先来看 Step 5 Preview 的表现。该模型采用了稀疏 MoE 架构,总参数量达 600B,但每个 Token 实际激活 27B 参数,并支持 1M 上下文和视觉输入。测试结果显示,Step 5 Preview 在整个任务过程中展现了出色的自动化能力。它不仅完成了代码编写,还主动进行了多次自我测试和修复。例如,在代码完成后,模型会通过浏览器报错信息查找问题,同时还会检查游戏画面的实际渲染情况,确保 UI 组件完整且功能正常。最后,模型甚至会进入游戏内部进行交互测试,确认移动和放置等功能无误后才完成交付。
值得注意的是,Step 5 Preview 在任务完成后还进行了清理操作,删除了测试文件和多余文件,只保留最终项目文件,使目录保持整洁。整个过程耗时约 55 分钟,消耗约 1700 万 tokens,成本约为 12 元人民币。从数据上看,虽然 token 消耗较高,但这是由于模型在自我检测环节花费了较多时间,而最终交付质量较高,因此整体性价比依然突出。
接下来是 DeepSeek V4 Pro 的表现。该模型的整体流程与 Step 5 Preview 类似,同样经历了环境检测、代码编写和测试修复三个阶段。然而,在测试修复环节,DeepSeek V4 Pro 的表现与 Step 5 Preview 出现了显著差异。尽管模型也检测到了一些 Bug 并进行了修改,但这些修改并未完全反馈到最终交付结果中。当作者打开 Demo 时,发现无法正常进入游戏,经过重新启动后虽能进入,但页面存在明显问题,物品栏等功能未完全实现。
相比之下,GLM5.3 的表现则更为一般。在测试过程中,模型未能完成任务的核心部分,代码生成存在较大缺陷,导致项目无法正常运行。这表明在处理复杂 Agent 任务时,GLM5.3 的能力仍有较大提升空间。
通过对比可以看出,Step 5 Preview 在任务自动化程度和最终交付质量上明显优于其他两款模型。特别是在自我检测和修复环节,Step 5 Preview 展现出了更强的能力。这不仅体现在代码质量上,还表现在对项目完整性的把控上。相比之下,DeepSeek V4 Pro 虽然也有一定的自动化能力,但在关键环节的执行上仍显不足;而 GLM5.3 则在基础任务执行上就出现了较大问题。
从技术架构来看,Step 5 Preview 的稀疏 MoE 架构为其提供了强大的计算能力和灵活性。这种架构允许模型在处理复杂任务时动态调整参数规模,从而在保证性能的同时降低实际任务成本。这也是为什么在相同智能水平下,Step 5 Preview 的任务成本明显低于其他同级模型的原因之一。
总的来说,这次实测充分展示了 Step 5 Preview 在复杂 Agent 任务中的优势。其强大的自动化能力、细致的测试修复流程以及高效的资源利用,使其成为当前国产大模型中值得重点关注的一款产品。对于需要处理复杂任务的企业和个人开发者来说,Step 5 Preview 提供了一个高效且可靠的解决方案。