Anthropic安全承诺被改写,AI竞速压力下安全悖论凸显
Anthropic研究员Jacob Coxon在股权归属前辞职,揭示了AI公司在竞争压力下难以维持安全承诺的行业困境。文章分析了Anthropic与OpenAI近期对安全框架的调整,指出竞速压力导致安...
2026年9月8日,知名AI公司Anthropic的安全承诺体系遭遇重大变局。研究员Jacob Coxon在距离第一批股权归属仅两个月时选择离职,其公开表态揭示了一个深刻的行业悖论:即使是最强调安全的AI公司,也无法在激烈的市场竞争中坚持原有的安全承诺。
Coxon在X平台上的帖子浏览量超过1.47亿,他明确表示,Anthropic仍然是“最负责任的参与者”,但他认为整个行业都面临着同样的困境。"如果你面临竞赛压力,你就必须抄近路,或者跳过监督流程中的步骤。"这是他对当前AI行业发展现状的精准概括。
这一观点得到了进一步印证。2023年,Anthropic曾发布《负责任扩展政策》,其中明确规定:如果无法部署所需的安全措施,就必须暂停训练更强大的模型。这是一个不可协商的刚性约束。然而,到了2026年2月,Anthropic发布的RSP 3.0版本中,这条硬性暂停机制被取消,取而代之的是更强调路线图、风险报告和外部监督的柔性框架。
与此同时,OpenAI也在同一时期对其使命陈述进行了调整。2024年度IRS表格(990表)于2025年11月发布,其中将原本包含"safely"和"不受财务回报需求约束"的表述删除。这种变化并非孤例,OpenAI在过去两年内陆续解散了三个安全团队:Superalignment Team(2024年5月)、AGI Readiness Team、Mission Alignment Team(2026年2月)。
这一系列变动引发了业界对AI安全框架的广泛讨论。Morningstar在Coxon辞职后发布报告,将Fable 5事件定性为通过监管干预、收入持续性等渠道影响投资判断的财务风险。报告指出,若安全承诺可被竞争压力修改,其在IPO定价中应被充分打折。
值得注意的是,尽管Anthropic和OpenAI都在强调安全的重要性,但实际操作中却显示出明显的矛盾。2026年6月,Fable 5发布后因越狱漏洞被亚马逊举报,三天内遭美国政府强制下线。这证明在红线被改写后,真正阻止风险的并非公司的事前机制,而是风险释放后的外部强制干预。
面对这一局面,两大AI巨头开始发出"减速"信号。9月12日,OpenAI CEO奥特曼公开宣布,鉴于当前AI安全状况,现在上市并不明智,公司2026年不会IPO。同一天,Anthropic CEO达里奥·阿莫迪发文呼吁全行业放慢模型能力提升步伐,并提出"检查点"机制:模型一旦具备危险能力,必须先通过评估、可解释性分析和训练环境审计组成的对齐认证。
这一转变反映出AI行业正在经历一场深刻变革。一方面,随着AI能力的快速提升,安全问题日益凸显;另一方面,市场竞争压力迫使公司不得不在安全与速度之间做出艰难抉择。这种矛盾不仅存在于Anthropic和OpenAI之间,也体现在整个AI行业中。
专家指出,这种安全与速度之间的悖论可能会长期存在。"为了更安全,我们必须更快(防止对手先造出更不安全的超级智能),但更快就必然更不安全。"Coxon的这句话一针见血地指出了问题的本质。
当前,AI行业的安全框架正在经历一场系统性的重构。从Anthropic和OpenAI的变化可以看出,传统的刚性安全承诺正在被柔性化的风险管理框架所取代。这种转变虽然在一定程度上适应了AI快速发展的需求,但也带来了新的挑战:如何在保证速度的同时确保安全性?
未来,AI行业的安全问题可能需要通过更严格的外部监管、更透明的风险披露机制以及更完善的第三方评估体系来解决。同时,也需要行业内部达成共识,建立统一的安全标准和评估体系,以应对日益复杂的AI安全挑战。