大模型为何难实现科学发现?爱因斯坦测试揭示AI认知局限
在人工智能领域,大语言模型(LLM)的发展速度令人瞩目。然而,当我们将目光投向科学发现这一人类智慧的巅峰时,却发现这些强大的模型似乎遇到了难以逾越的障碍。2026年2月,Google DeepMind...
在人工智能领域,大语言模型(LLM)的发展速度令人瞩目。然而,当我们将目光投向科学发现这一人类智慧的巅峰时,却发现这些强大的模型似乎遇到了难以逾越的障碍。2026年2月,Google DeepMind掌门人哈萨比斯在印度的“AI影响力峰会”上提出了一个极具挑战性的标准:将AI系统的知识库截止于1911年,看它能否像爱因斯坦在1915年那样独立推导出广义相对论。这个被称为‘爱因斯坦测试’的标准,实际上是对当前AI科学发现能力的一次终极检验。
早在哈萨比斯提出这一测试前一个月,Google DeepMind资深研究员Tom Zahavy就在《LLMs can't jump》一文中对AI的科学发现能力进行了深入剖析。论文指出,科学发现的本质远非简单的数据压缩或模式匹配,而是一个包含‘感知经验→跳跃式假设→公理系统→逻辑推导’的复杂过程。爱因斯坦构建广义相对论的经历正是这一过程的完美体现:他从麦克斯韦方程出发,通过‘骑光幻想’这一思想实验,完成了从经典物理学框架到全新时空观的‘跳跃’。
论文进一步引用了19世纪美国逻辑学家皮尔士(C.S. Peirce)的理论框架,将人类思维机制分为归纳、演绎和溯因三种类型。当前大语言模型在归纳和演绎方面已经表现出色,但溯因推理——即生成新颖解释性假设的能力——仍然是AI的短板。这种能力需要将抽象符号与物理体验相结合,而现有的文本驱动型模型显然无法胜任这一任务。
值得注意的是,DeepMind提出的‘爱因斯坦测试’不仅是一个理论上的挑战,更揭示了当前AI架构的根本局限。要实现真正的科学发现,AI需要具备物理一致性世界模型(Interactive World Models),能够进行具身仿真和反事实干预。这表明,未来的AI研究必须突破纯文本处理的范式,转向多模态、具身化的智能体设计。
这一发现对AI科学领域的研究方向具有重要指导意义。它提醒我们,单纯扩大模型规模或增加数据量并不能解决科学发现的问题,而是需要从根本上重新设计AI的认知架构。未来的研究可能需要结合具身智能、物理仿真和跨学科知识融合,才能真正实现AI在科学发现领域的突破。