超衍智能自动化AI系统刷新三项SOTA记录,开启AI自我改进新阶段

近日,由清华教授陈勇超创办的超衍智能(Apex Intelligence)发布其自动化AI研究系统的首批评估成果。该系统在SLDBench SimpleTES、NanoChat Autoresearc...

人工智能

在人工智能领域,一项具有里程碑意义的技术突破正在发生。9月8日,超衍智能(Apex Intelligence)宣布其自动化AI研究系统在首次系统性评测中取得了三项新的官方SOTA(State-Of-The-Art)纪录,这一成果不仅展示了AI自我改进的巨大潜力,也为未来AI技术的发展指明了方向。

超衍智能成立于2026年6月,由清华大学人工智能学院助理教授陈勇超创立,专注于构建自主进化基础模型。此次发布的自动化AI研究系统采用了一种全新的递归研究范式,能够实现从问题发现到实验验证的全流程自主闭环。与传统的AI研究模式不同,这套系统不仅能提出改进方案,还能通过实验证据不断强化自身的研究能力,形成持续的自我提升循环。

文章配图

在具体的评测结果方面,超衍智能的系统在以下三个关键任务上表现突出:

  • SLDBench SimpleTES:这项任务要求AI系统从已发表的5000组语言模型训练实验中推断出Scaling Law规律,并预测未参与拟合的规模区间表现。超衍智能的系统在四项子任务中的平均得分达到0.8846,比现有参考结果提升了约2.71%。其中,U-shaped scaling的提升最为显著,从0.4975跃升至0.5761,增幅达15.80%。
  • 文章配图
  • NanoChat Autoresearch:针对有限计算资源下的模型优化问题,该系统在B200显卡环境下,通过修改模型架构和训练代码,在300秒内实现了显著的性能提升。相比ScienceGuru参照实现,峰值显存使用量降低了约20%,同时保持了更高的训练效率。
  • MLS-Bench Fused Causal Attention:在构建正确的OpenAI Triton fused causal attention kernel任务中,超衍智能的系统在三种配置下均实现了超过27%的吞吐量提升,远超现有SOTA水平。
  • 文章配图

    这些成果的背后,是超衍智能对AI自我改进机制的深入探索。以SLDBench评测为例,系统通过将实验曲线拆分为长期趋势和短期影响两部分,有效避免了小规模实验数据可能导致的错误外推。而在NanoChat Autoresearch任务中,系统通过对梯度计算过程的精细优化,成功减少了不必要的资源浪费。

    "当AI开始改进AI时,会发生什么?"这是超衍智能在其官方推文中提出的问题。根据此次评测结果,答案似乎已经显现:AI不仅能够帮助人类完成复杂的研发工作,更有可能通过自我改进,逐步承担起下一代AI系统的设计与开发任务。这种递归自我改进(Recursive Self-Improvement, RSI)的能力,将彻底改变AI技术的发展节奏。

    目前,包括OpenAI和Anthropic在内的多家顶尖AI公司也在积极探索类似的RSI路径。但超衍智能的成果表明,完全自主的AI研究系统已经开始展现出超越人类工程团队的实力。随着这项技术的进一步发展,未来的AI系统可能会以指数级的速度自我提升,为整个科技行业带来前所未有的变革。