AI平均3小时完成数学证明,OpenAI发布722篇手稿引发争议

OpenAI近日宣布其内部模型在平均3小时算力下生成了722篇数学研究手稿,涵盖多项重大数学猜想。然而,这一成果因缺乏透明度、与现有研究存在优先权争议以及形式化验证不一致等问题,引发了数学界的广泛质疑...

人工智能

10月6日,OpenAI在其官方账号上发布了一项引人注目的科研成果:由一款尚未公开的内部模型撰写的722篇数学研究手稿。这些手稿被归纳为17个领域的372个成果类别,其中162篇附有主结果的Lean形式化证明。

根据OpenAI的声明,每项成功结果消耗的算力相当于ChatGPT Pro思考3小时。这些成果涵盖了多个数学领域的重要问题,包括四维Kakeya猜想、广义黎曼猜想相关问题、唯一游戏猜想、自由群因子同构问题、有理数域上的希尔伯特第十问题、CM阿贝尔簇的霍奇猜想、马勒猜想等。

然而,这一发布立即引发了数学界的广泛关注和争议。OpenAI发言人向《科学美国人》表示,公司尚未公开发布的全新模型几乎所有的结果都是在向单个代理发出单一指令后生成的。如果属实,这意味着人工智能可能具备前所未有的数学能力,能够快速生成复杂的数学证明。

争议的焦点之一是OpenAI声称解决的纳维-斯托克斯千禧年难题。该难题自2000年由克雷数学研究所设立以来,一直是全球数学界关注的焦点。OpenAI表示,其系统给出了解析证明和Lean形式化证明,表明初始静止且光滑的流体可在有限时间内产生奇点。然而,在OpenAI官宣消息的12小时前,纽约大学数学家特里斯坦·巴克马斯特和他在Anthropic任职的合作者莱文特·阿尔珀格已经公开了相近成果。

巴克马斯特认为OpenAI在成果发布、署名和优先权处理上存在问题,并称对方曾要求排除阿尔珀格。OpenAI则否认使用他们的私人数据,坚称研究是独立完成的。这场优先权争议目前尚无定论。

更大的问题是,Lean验证并不等于这些成果已经被数学界确认。米兰比可卡大学副教授瓦莱里奥·卡普拉罗指出,OpenAI纳维-斯托克斯方案的论文和Lean代码至少存在两处不一致:论文中的一个估计只需要四个额外的输入导数,而Lean版本却需要五个;论文中的压力-通量估计也采用了不同的界限和证明方法。

图1展示了局部不可压缩流动的一个瞬时状态,橙色表示旋转角速度较大,蓝绿色表示旋转角速度较小。沿圆周方向运动的线速度还取决于旋转半径。轨迹显示了向内盘旋和轴向拉伸的现象,这与纳维-斯托克斯方程描述的流体运动特性密切相关。

数学家们对OpenAI的发布方式提出了批评。他们认为,领先的人工智能公司给人一种“黑帮行为的印象”。9月21日,OpenAI宣布将组建一个由数学家组成的独立顾问小组,就如何负责地发布人工智能生成的计算结果提出建议。小组特别强调,应该公布结果背后的模型、具体的提示信息和计算时间,因为专有内部模型并未向数学家广泛开放。

图2

然而,OpenAI选择仅公布问题的平均计算时间以及一些额外的统计数据,而没有提供任何提示信息。这种做法引发了数学界的不满,他们要求公开完整的模型、具体提示词和计算过程,以便进行复现和验证。

图2进一步展示了纳维-斯托克斯方程中流体运动的复杂性,特别是轴向拉伸(axial stretching)和向内螺旋(inward spiral)现象,这些细节对于理解流体动力学至关重要。

OpenAI在发布这些成果时,一次性放出了700多篇手稿,随后因发现符号错误撤回了3篇并修改了14篇。数学界担忧AI快速生成大量证明,人类缺乏时间和能力逐项验证,可能破坏研究的消化和信任流程。

图3

图3显示了OpenAI在其社交媒体账号上发布的声明,强调这些成果是由内部前沿模型生成的,并参考了高等研究院数学与人工智能独立咨询小组的建议。此外,OpenAI还开源了名为openai/math的GitHub项目,以促进学术交流。

麻省理工学院的数学家萨瑟兰表示,除非人们能复现结果,否则任何关于单智能体一次解决问题的说法都应视为未经证实。他呼吁数学界加强对AI生成成果的审查机制,确保研究的严谨性和可信度。

图4通过抽象的几何图案和数学公式,象征着人工智能在数学领域的应用前景及其带来的挑战。随着AI技术的快速发展,如何平衡创新与严谨成为数学界亟待解决的问题。

总的来说,OpenAI此次发布的成果虽然展示了人工智能在数学领域的巨大潜力,但也暴露出了一系列问题,包括透明度不足、优先权争议以及证明有效性存疑等。这些问题不仅影响了研究成果的可信度,也对未来的AI辅助数学研究提出了新的要求和挑战。