Kimi发布数学模型k0-math,对标o1提升推理能力

在Kimio上线一周年之际,月之暗面推出了基于强化学习的数学模型k0-math,该模型在多项测试中表现优异,尤其在高考和考研等场景下成绩突出。与OpenAI o1系列相比,k0-math展现了更强的推...

人工智能

在人工智能领域,数学推理能力一直是衡量AI智能水平的重要指标之一。2024年11月16日,在Kimio全网上线一周年之际,月之暗面(Kimi)正式发布了其最新研发的数学模型k0-math。这款模型采用强化学习技术,旨在通过模拟人类思考过程来提升AI的推理能力,特别是在解决复杂数学问题时的表现。

根据官方公布的数据,k0-math在中考、高考、考研以及入门竞赛题(MATH基准测试)等多个场景下的表现均优于OpenAI o1系列模型中的o1-mini和o1-preview版本。例如,在高考数学北京卷的测试中,k0-math取得了不错的成绩,但在更复杂的题目上仍有一定压力。值得注意的是,尽管k0-math擅长处理高难度数学题,但对于LaTeX格式难以描述的几何图形类问题,当前版本还无法有效解答。

Kimi创始人杨植麟在接受采访时表示,选择数学作为切入点是因为他认为这是最适合锻炼AI思考能力的场景。"这是一个不断思考、不断试错的过程,而且不需要与外界进行交互。"他进一步指出,k0-math不仅能够帮助用户解锁更多有挑战性的工作任务,还有望在基础科学领域(如物理、生物、化学)解决一些尚未被攻克的难题。

然而,k0-math并非完美无缺。在一些简单问题上,比如计算"1+1等于几",模型可能会出现过度思考的现象,反复验证多次才给出答案。这种现象主要源于奖励机制的设计,目前系统没有对思考长度进行限制,而是允许模型自由发挥。对此,杨植麟表示,这将是后续技术升级需要重点解决的问题之一。

除了新模型的发布,Kimio探索版也将推出更多具有推理能力的功能。其中包括意图增强功能,可以将模糊的问题具象化,更好地理解用户的真实需求;信源分析功能,提供更具权威性和可靠性的信息来源,并能在答案中一键定位具体出处;以及链式思考功能,基于思维链(CoT)处理能力,对问题进行逐步拆解。

在技术实现方面,k0-math采用了强化学习和合成数据相结合的方式,突破了传统静态数据集的限制。杨植麟认为,这种方法不仅能够释放Scaling Law的潜力,还能显著提升AI在各个领域和场景的推理能力和智能水平上限。"我们判断,接下来最重点的东西会在强化学习上,范式上会产生一些变化。但它还是Scaling,只是说会通过不同的方式去Scale。"

针对近期业内关于Scaling Law是否为天花板的讨论,杨植麟表达了乐观态度。他认为,通过引入强化学习和合成数据,AI模型可以在不依赖大量真实数据的情况下,实现更高效的训练和更好的性能表现。"对于强化学习来说,这是一个核心问题。比如,像以前做next token prediction,它是一个静态的数据集使用方式,现在用强化学习的方式,很多情况下是有人在参与的,所以其实是AI本身,再把人的东西加一个杠杆。"

演讲介绍Scaling Law

此外,k0-math的推出也引发了业界对AI推理效率和成本的关注。花旗银行的研究报告显示,最新前沿模型在性能和每项任务成本方面均有显著改善,这可能有助于强化较高效率模型相对较低效率开源权重替代方案的长期经济优势。同时,小米集团旗下的MiMo-V2.6-Pro模型也展示了通过agentic RL取得能力提升的成本已变得低廉,进一步证明了强化学习在提升AI性能方面的潜力。

总体来看,k0-math的发布标志着Kimi在AI数学推理领域的重大突破,也为整个行业提供了新的技术方向。虽然目前还存在一些局限性,但随着技术的不断迭代和完善,相信k0-math将在未来发挥更大的作用,推动AI技术在更多领域的应用和发展。

图1:k0-math界面展示,左侧为详细解题步骤,右侧为计算过程,体现了模型强大的推理能力。

OpenAI o1模型选择界面

图2:一位研究人员正在介绍k0-math背后的Scaling Law技术原理,强调了强化学习和合成数据的重要性。

图3:OpenAI o1模型选择界面,显示了o1-preview作为默认选项,突显了其在推理能力上的优势。

图4:测试成绩对比图表,清晰展示了k0-math在多个测试场景下的优异表现,尤其是在高考和考研等高难度场景下领先于其他模型。