7名博士生3月训7B大模型,AI4AI范式开启自主造AI新时代

北京中关村学院7名博士生仅用3个月,从零训练出70亿参数(7B)基础模型ZGCM-1。该团队开创性地采用数百个Agent协作模式,实现数据处理、实验运行、评测分析等全流程自动化,将传统大模型研发中数百...

人工智能

在人工智能领域,一个令人瞩目的突破正在发生。近日,北京中关村学院的7名博士生团队宣布,他们仅用3个月时间,就成功从零开始训练出一个70亿参数(7B)的基础模型——ZGCM-1。这一成果不仅展示了小型研究团队在AI领域的强大潜力,更开创了一种全新的「AI4AI」研发范式。

ZGCM-1性能概览

该模型的训练过程完全公开,包括各阶段的训练数据、配方、模型权重、训练代码、中间检查点和日志,均向全球研究者开放。这种透明化的做法,使得其他研究者可以追溯和复现整个训练流程,为AI模型开发提供了宝贵的参考。

在多项通用评测中,ZGCM-1的表现与Qwen3-8B等同规模模型相当;在数学推理和搜索任务上,它甚至能与更大规模的Qwen3-235B-A22B、GLM-5.1等模型媲美。然而,真正引人深思的是,这样一个复杂的大模型研发项目,通常需要数百人的专业团队协作完成,而这个7人团队是如何做到的?

"我们最初的想法很简单,就是想自己动手训练一次模型,看看能不能理解那些技术报告里提到的内容。"团队成员之一、人工智能方向的博士生李明回忆道。"当时我们甚至想用这个7B模型去挑战Sonnet这样的模型,虽然参数量有限,但我们可以让模型学会搜索和使用工具来弥补知识不足。"

为了实现这一目标,团队创造性地引入了数百个Agent协作系统。这些Agent被分配到数据处理、实验运行、日志分析、结果评测等各个环节,每个研究员负责指导数十个Agent,实现了全流程的自动化推进。

AI4AI协作模式示意图

"我们把整个模型研发流程拆解成多个环节,每个环节都对应一个Agent子团队。"团队负责人张伟介绍,"比如在数据处理环节,Agent会根据我们设定的质量要求自动编写清洗脚本,检查数据分布,并根据结果自动调整规则和阈值,形成一个闭环。在实验环节,Agent也能自主提出实验方案并执行,然后将结果反馈给我们进行判断。"

这种「AI4AI」的研发模式,不仅大幅提高了工作效率,还让团队成员能够专注于更高层次的战略决策和关键问题解决。通过这种方式,原本冷冰冰的知识和概念,开始与具体的实现过程紧密结合,使得每一次训练失败都能得到及时的诊断和改进。

AI4AI协作流程图

"最开始的时候,我们以为只要几个人就能搞定所有事情。"团队成员王强说,"但真正开始训练之后才发现,数据清洗、去重、格式检查、分布核对等工作量巨大,而且需要反复迭代。当所有这些任务同时压在我们身上时,工作量远超我们的承受范围。"

正是在这种情况下,团队决定引入Agent协作系统。通过这种方式,他们成功将繁重的任务分解给Agent,每个研究员只需要负责高层次的指导和判断,而具体的执行工作则由Agent完成。

"我们就像指挥官一样,告诉Agent我们需要什么,它们就会去完成相应的任务。"团队成员赵丽解释道,"这种模式让我们能够专注于算法设计和模型优化,而不是被琐碎的工程细节所困扰。"

这个项目的灵感其实来源于一次火锅聚餐。当时,团队成员们在讨论如何更好地理解和应用现有的AI技术,最终萌生了自己动手训练模型的想法。"我们平时更多是在现成模型上做微调,很多技术细节还是不太明白。"团队成员陈宇说,"比如数据怎么选,训练出了问题怎么查,最后写进报告里的方法又是经过多少次失败才确定下来的。我们想通过这次实践,把这些东西真正弄清楚。"

为了验证Agent系统的有效性,团队还对整个模型研发过程中Agent的表现进行了评级。这项工作不仅为本次完整的模型训练实践提供了真实的工程结论,也为未来类似项目的实施提供了宝贵的经验。

"我们希望这次实践能够为AI自主研发提供一些启示。"张伟表示,"通过这种方式,我们证明了即使是一个小型团队,也能够完成大型模型的研发工作。这可能会改变未来AI模型开发的模式。"

随着ZGCM-1的成功发布,这个项目不仅展示了小型团队在AI领域的巨大潜力,也为AI自主研发提供了全新的思路。通过「AI4AI」范式,未来的AI模型开发可能会变得更加高效和普及,让更多研究者能够参与到AI技术的创新和发展中来。