哈佛教授Sham Kakade揭示,二次模型如何精准预测LLM预训练动态

当大模型预训练还在依赖大量启发式规则苦苦调参时,哈佛大学计算机科学系Gordon McKay教授、Kempner研究所联合主任Sham Kakade抛出了一项颠覆性的研究成果。他在ICML 2026的...

人工智能

当大模型预训练还在依赖大量启发式规则苦苦调参时,哈佛大学计算机科学系Gordon McKay教授、Kempner研究所联合主任Sham Kakade抛出了一项颠覆性的研究成果。他在ICML 2026的特邀演讲《How Far Can Quadratics Take Us? Lessons for LLM Pretraining》中系统论证了一个反直觉的结论:一个简单到极致的二次模型,就能精准还原大语言模型在动态预训练中的绝大部分优化效果。

图片

Kakade教授的研究基于泰勒定理(Taylor's Theorem),他直接在真实大规模神经网络的不同checkpoint上进行泰勒展开,构建出对应的二次模型。通过在这个二次模型上继续训练,并将损失轨迹与真实网络逐点对比,研究团队发现两条曲线近乎完全重合。这意味着,在LLM预训练的关键窗口内,那些被忽略的高阶项几乎没有任何贡献,真实网络的预训练动态在关键路径上本身就是近似二次的。

这一发现具有深远意义。它不仅揭示了预训练本质的朴素性,还为解决一系列基础问题提供了新思路:如何判定模型训练的最优停止时机?如何确定所需的数据总规模?能否设计出一种无需事先设定停止时间、能够持续训练的方法?如何选取最优的批量大小(Batch Size)?就串行运行时间(Serial Runtime)而言,能将训练速度推向多快?动量(Momentum)如何在大规模分布式训练中发挥作用?

Kakade教授指出,这些看似复杂的问题,都可以在这个朴素、清晰的二次框架下得到解答。例如,二次模型能够精确算出临界批量大小与动态最优学习率,揭示动量的真实作用边界。更重要的是,这个模型不是去拟合训练数据,而是直接还原了预训练的本质。

"我们可能对其中一些非常基础的问题尤其感兴趣:比如如何判定模型训练的最优停止时机?如何确定所需的数据总规模?能否设计出一种无需事先设定停止时间、能够持续训练的方法?"Kakade教授在演讲中强调,这些问题的核心在于理解预训练的动力学本质,而二次模型正是通往这一理解的桥梁。

这项研究的意义不仅在于理论突破,更在于实践指导。通过这个二次模型,研究人员可以更高效地设计和优化预训练策略,减少不必要的计算资源浪费。同时,它也为未来更大规模模型的训练提供了新的理论基础。

"预训练是我们构建基础模型的基本范式,我们的核心目标,便是在计算效率、数据利用率以及训练速度上将其推向极致,"Kakade教授总结道,"而这个二次模型,正是实现这一目标的关键工具。"