ECCV2026主题演讲,计算机视觉从「看懂」到「教会」人类新范式

在 ECCV 2026 大会上,得克萨斯大学奥斯汀分校教授 Kristen Grauman 提出计算机视觉的下一个十年发展方向——从单纯理解视觉信息转向成为帮助人类学习现实世界技能的 AI Guide...

人工智能

过去十年,计算机视觉技术取得了显著进步,从图像分类、目标检测到三维重建和视频理解,机器对视觉世界的"看懂"能力已达到较高水平。然而,正如得克萨斯大学奥斯汀分校教授 Kristen Grauman 在 ECCV 2026 主会首场 Keynote 演讲中指出的,"机器越会‘看懂人’,人获得的实际帮助并没有同步增长"。

Grauman 的演讲主题为《From Machine Perception to Human Expertise》,她强调计算机视觉不应仅停留在"观察者"角色,而应发展成为能够"帮助人学会"的系统。这一理念的核心在于,视觉 AI 不再只是识别画面内容,而是要理解人在真实世界中的持续活动,预判下一步动作,并在关键时刻给出个性化反馈,最终实现对"人有没有真的学会"的评估。

"我们已经看到一系列令人兴奋的突破,"Grauman 说,"但这些能力很大程度上都在做同一件事:让机器成为一个能力越来越强的‘观察者’。现在是时候换个角度来看这个问题了:机器感知已经越来越强,这些能力接下来能为人做什么?"

这一转变具有深远意义。以康复训练为例,传统方式需要专业人员持续提供个性化指导,但这种方式成本高昂且难以普及。如果引入 AI Guide,它可以通过持续观察患者的动作,理解其进展,并在错误发生前主动提醒,从而大幅降低专业指导的成本和门槛。

Grauman 的研究团队长期致力于推动计算机视觉从识别画面走向理解真实世界活动。作为 Ego4D、Ego-Exo4D 等项目的重要推动者,她的工作一直在探索如何让机器更好地理解第一人称视角下的复杂活动。在本次演讲中,她将这一脉络凝练为对计算机视觉未来发展的判断:AI 应该从"看懂人"走向"帮助人学会",成为能够理解动作、预判下一步,并在关键时刻给出个性化反馈的系统。

"这正是我感兴趣的方向,"Grauman 说,"借助 AI,现实世界中的技能和 know-how,或许也能变得更加普及。"这一观点与当前计算机视觉行业的趋势高度契合。根据中研普华产业研究院的预测,通用视觉大模型正在逐步替代大量专用小模型,降低新场景开发周期,特别是在工业视觉领域,标准化视觉设备的增多正在降低定制成本。

"我们面临的两个核心技术问题,"Grauman 继续说道,"第一个是细粒度的人类活动理解,我们需要知道一个人究竟在做什么,以及这些活动之间的关系;第二个是如何在关键时刻给出可执行的反馈,并持续跟踪学习进度。"

这一转型不仅对技术提出了更高要求,也对行业生态产生了深远影响。对于老牌 CV 龙头企业而言,虽然他们拥有丰富的项目交付经验,但在通用视觉大模型时代,如何平衡传统模型与新模型的关系将成为关键挑战。而对于新兴的视觉大模型厂商来说,虽然通用性强、新场景适配更快,但在产线复杂缺陷识别精度方面仍需提升。

图2

"竞争方向已经从单一目标检测精度,转向模型通用性、工程落地能力、软硬件集成能力,"Grauman 总结道,"这是计算机视觉行业进入新阶段的重要标志。"

这一转变将推动计算机视觉技术在更多领域的应用。在工业质检领域,标准化视觉设备的普及将大幅提升中小工厂的智能化水平;在康复训练领域,AI Guide 的引入将使专业指导更加普惠;在自动驾驶领域,更强大的视觉理解能力将提升车辆的安全性和可靠性。

"我们正站在一个转折点上,"Grauman 最后表示,"计算机视觉的下一个十年,将不再是单纯追求更高的识别准确率,而是要真正改变一个人的学习过程,让原本稀缺的专业指导变得更可及。"