LeCun演讲揭示AI局限,预测像素是伪命题,JEPA开启新路径

在ECCV 2026大会上,深度学习三巨头之一Yann LeCun发表Keynote演讲,指出当前AI系统无法真正理解物理世界,预测像素是伪命题。他提出JEPA架构作为突破方向,强调从视频和传感器中构...

人工智能

在2026年9月于瑞典马尔默举行的ECCV大会上,深度学习领域的领军人物、图灵奖得主Yann LeCun发表了一场题为《World Models: Enabling the next AI revolution》的Keynote演讲。这场演讲不仅引发了计算机视觉领域从业者的强烈共鸣,也为人工智能的发展方向提供了重要启示。

LeCun首先指出,尽管近年来大模型和Scaling Law取得了显著进展,但AI系统在理解和应对真实物理世界方面仍存在根本性障碍。他以预测像素为例,解释了这种看似简单的任务实际上包含了大量不可预测的变量,"你把摄像头对准房间一角开始录像,下一帧会拍到什么,取决于镜头外有没有人走进来、光线会不会变化。而这些信息,在‘当前帧’里根本不存在。"

围绕这一核心观点,LeCun详细阐述了当前AI技术面临的四大挑战:

  • 预测像素本质上是一个伪命题,因为真实世界的连续性和高维性远超语言模型的处理能力;
  • 现有生成式模型(如Sora、Genie)虽然能生成逼真的图像序列,但缺乏对物理规律的真正理解;
  • 依赖显式物理引擎的仿真方法(如英伟达Omniverse)虽然精确,但计算成本高昂且难以扩展;
  • 当前主流AI系统仍然过度依赖语言和token,无法有效处理高维连续数据(如图像、视频、传感器输出等)。
  • 针对这些问题,LeCun提出了他的解决方案——JEPA(Joint Embedding Predictive Architecture)。与传统生成式模型不同,JEPA不试图生成未来画面,而是通过编码器丢弃那些不可预测的细节,只保留可预测、可规划的结构,在抽象表征空间中进行预测。这种方法避免了直接预测像素的困境,转而在更高层次的语义空间中寻找规律。

    "我们不能继续死磕生成式模型,也不能再研究LLM了,"LeCun在演讲最后给出了三个极具争议性的建议:转向联合嵌入,转向抽象表征,转向世界模型。他认为,只有当AI系统能够从视频、传感器与交互中学习并构建世界模型时,才能真正实现通用人工智能(AGI)。

    演讲幻灯片展示AI局限性

    为了验证这一理论,LeCun团队进行了多项实验。其中一项实验显示,当给同一组模型加上外部诚实包装(允许模型说'我不知道')后,正确率反而从43.9%下降到了21.3%,但胡编率(自信地答错)从25.8%降到了7.4%。这表明,单纯依靠外部规则并不能解决AI系统的根本问题,关键在于让模型真正理解世界。

    "真正的下一章,是让AI系统从视频、传感器与交互中,学习并构建世界模型;再用JEPA去理解世界,去预测行动后果,去规划出实现目标的动作序列。"LeCun的演讲不仅揭示了当前AI技术的局限性,更为下一代AI系统的发展指明了方向。这一理论框架的提出,可能将重新定义人工智能的研究范式,推动行业向更深层次的通用智能迈进。