AI自我改进RSI进展几何?OpenAI、Anthropic等巨头布局L1-L5等级路线图

随着 OpenAI 和 Anthropic 等公司推进 AI 自我改进(RSI)技术,从自动化研究到模型自我优化,AI 正在逐步实现递归式自我提升。最新研究将 RSI 分为 L1 至 L5 五个等级,...

人工智能

在人工智能领域,"人类造的最后一个 AI" 的概念再次引发热议。近期,OpenAI 总裁格雷格·布罗克曼表示 GPT-6 Astra 已接近通用人工智能(AGI)门槛,而随之兴起的新热词 "RSI"(Recursive Self Improvement,递归自我改进)则成为行业关注焦点。

RSI 指的是 AI 系统能够自主编写代码、运行实验并改进自身训练流程,进而生成更强大的下一代模型。这一理念最早可追溯至 1965 年英国数学家 I.J. Good 提出的 "智能爆炸" 设想:当机器能够设计出比自己更聪明的机器时,智能将进入加速正反馈循环。

目前,AI 行业对 RSI 的研究已从理论探讨转向实践布局。上海交通大学、清华大学等机构联合发布的预印本《The Last AI Built by Humans》首次系统性地将 RSI 自主性划分为 L1 至 L5 五个层级:

L1 层级主要负责执行人类给出的改进方案;L2 开始自主寻找改进策略;L3 可以决定需要获取哪些经验;L4 能够把部署环境中的反馈转化为持续保留的改动;而 L5 则进一步将改进机制本身也纳入改进对象,使 AI 不仅能完成研究任务,还能修改后续研究方法,并让后继系统继续使用这些改进后的机制。

在实际应用中,OpenAI 已经实现了 "自动化研究实习生" 目标,其系统能在人类指导下编写代码、运行实验、排查故障和分析结果。截至 8 月中旬,每投入一个人类工作日,OpenAI 研究部门的智能体运行时长相当于 3.1 个工作日。与此同时,Anthropic 的 Claude 系列模型也在安全研究方面取得突破,通过自我查文献、提方案、生成训练数据等方式,显著提升了模型的安全性能。

然而,RSI 的发展并非一帆风顺。尽管多家公司如 Google DeepMind、Meta、腾讯混元等都在积极探索不同路径,但距离完全体 RSI 仍有不小差距。例如,如何解决灾难性遗忘问题、如何实现研究判断力的自动化等,都是当前亟待攻克的技术难题。

值得注意的是,RSI 的快速推进也引发了关于安全与创新的激烈争论。OpenAI 和 Anthropic 的高管多次警告更强智能体可能带来的大规模网络攻击、失控和文明级风险,呼吁加强安全审查。但另一方面,英伟达 CEO 黄仁勋则认为,这种安全叙事实为维护芯片市场利益的手段,不应阻碍技术创新。

AI 自我改进全景图

这场口水战背后,实际上是算力与资本的利益分配之争。只有头部公司才能承担高昂的安全审查成本,这无形中构成了天然壁垒。同时,它们宣称更强 AI 可防御危险,形成 "越危险越需研发" 的闭环逻辑。

总体来看,RSI 的发展正处于关键阶段。从 L1 的基础执行到 L5 的终极目标,每一步都充满挑战。未来几年内,谁能率先突破技术瓶颈,谁就能在 AI 领域占据主导地位。而这一切的背后,不仅是技术的较量,更是商业利益的博弈。

正如这些图表所示,RSI 的实现需要跨学科协作,涉及科学发现、嵌入式智能、软件工程等多个领域。只有整合多方资源,才能推动 RSI 技术真正落地,迈向真正的递归自我改进时代。