AI仅用11天完成费马大定理形式化证明,代码量超3万行

在人工智能技术快速发展的背景下,一项具有里程碑意义的数学成就近日诞生:由Anthropic开发的Claude AI模型,在基本自主运行11天后,成功完成了困扰数学界长达358年的费马大定理(Ferma...

人工智能

在人工智能技术快速发展的背景下,一项具有里程碑意义的数学成就近日诞生:由Anthropic开发的Claude AI模型,在基本自主运行11天后,成功完成了困扰数学界长达358年的费马大定理(Fermat's Last Theorem)首个完整、可由计算机验证的形式化证明。

图片

这项成果不仅刷新了AI处理复杂数学问题的速度纪录,更标志着人工智能在数学领域应用的重大突破。根据计算,整个证明过程生成了约1300万行Lean编程语言代码,涉及超过3万个中间定理,最终确认了其中约29,500个定理的有效性。这些代码若以每页50行打印,将铺满26万页,相当于520本500页的学术专著。

"如果费马大定理可以,那大概什么都可以",多伦多大学数论学家Daniel Litt如此评价这一成就。此前,伦敦帝国理工学院教授Kevin Buzzard曾领导一个大型开源项目,计划用Lean工具完成费马大定理的机器验证,预计需要数学家们耗费数年时间。而Claude仅用11天就完成了这一任务,效率提升数十倍。

这一突破的关键在于Anthropic开发的协作机制。Claude调用了数十个智能体并行工作,每个智能体负责特定的数学任务,如补全定义、推导中间引理或整合不同部分的证明。为解决多智能体协作中的上下文遗忘问题,Anthropic研究员彭天翼(Tianyi Peng)团队开发了Prove2Me工具,通过有向无环图(DAG)记录每个定理及其依赖关系,确保各智能体能够清晰了解全局进度。

"以前,我有99.9%的把握认为怀尔斯的证明是正确的,在Claude的工作后,我现在是100%确信。"Buzzard教授表示,这一成果不仅验证了经典数学证明的正确性,还可能改变数学研究和同行评议的方式。随着论文数量增多、篇幅变长、内容更复杂,传统的同行评议方式变得越来越耗时且效果有限。AI形式化和Lean认证有望简化这一过程,提高数学研究的效率和可靠性。

尽管这一成就令人振奋,但也引发了关于数学知识库标准化的讨论。Claude生成的代码包含大量独立的中间定理,与现有的Mathlib Lean代码库不完全兼容。Buzzard指出,将这些成果整合到现有系统中仍需大量工作,这可能导致多个不兼容的Lean库并存,给数学界带来新的挑战。

"随着论文数量增多、篇幅变长、内容更复杂,同行评议变得更加耗时,效果也变差了。"加州大学圣地亚哥分校数学家Frederick Manners表示,AI形式化和Lean认证能极大地简化同行评议工作,因为这一工作在数学领域尤其令人感到痛苦。

这一成果的实现成本约为30万美元,主要消耗在60亿个输出Token上。尽管费用高昂,但其带来的确定性和效率提升,使得这一投资在数学研究领域具有重要意义。

"按照当前的发展速度,AI或许不久就能审视整个数学知识库,甚至可能发现某些著名结论是错误的。"Buzzard预测,未来AI将在数学研究中扮演更加重要的角色,从辅助验证到主动发现新定理,都将推动数学研究进入一个全新的时代。