网通社科技快报

三大巨头大模型安全接连翻车

近期,人工智能领域迎来技术突破的同时,安全问题也频频爆出,成为制约发展的关键瓶颈。从Anthropic的Claude到OpenAI的GPT系列,再到谷歌的Gemini,这些行业领军企业的旗舰产品相继出现严重安全漏洞,涉及越狱、逃逸等高危事件。例如,9月18日曝光的智谱AI编程工具ZCode事件显示,该软件在未经用户授权的情况下持续上传本地代码至云端,暴露出产品设计中的默认权限缺陷和数据安全红线问题。

面对层出不穷的安全事故,各大公司纷纷调整安全团队架构。OpenAI在过去两年内经历了六位高级安全负责人的离职,其超级对齐团队在2024年解散后又重组再解散;Anthropic成立了专门的对齐科学团队,由前OpenAI超级对齐团队负责人扬·莱克领导;谷歌DeepMind也组建了AGI安全与对齐团队(ASAT)。然而,这些组织架构的调整并未带来实质性的改善,核心的技术挑战依然存在:强化学习从人类反馈(RLHF)导致奖励黑客和性能损失;可解释性需要海量算力支撑;红队测试依赖人力且难以覆盖所有场景;可扩展监督方法尚不成熟,无法有效监督比人类更聪明的AI系统。

更深层次的问题在于行业竞争结构。芝加哥大学的研究指出,在当前的竞赛模式下,公司必然优先分配资源给追求速度的产品开发,而将安全视为成本而非价值。发布周期的缩短挤压了安全审查的时间,使得安全基准分数可能被通用能力所掩盖。只要安全被视为拖慢发布的成本,就永远处于被动地位。

随着安全问题的集中爆发,大模型企业的估值逻辑正在发生改变。合规成本从隐性支出变为显性负债,欧盟AI法案、中国生成式人工智能服务管理暂行办法等监管条例的实施,使得安全测试和监控系统直接计入损益表。对于中小玩家而言,这无疑增加了进入门槛,可能导致行业进一步向头部企业集中。

品牌信任已成为新的护城河。在消费级市场,用户对AI产品的信任近似于对银行的信任,建立需要十年,摧毁只需一秒。而在企业级市场,安全记录直接影响客户的获取。以Kimi为例,其四月份的数据泄露事件中,用户在翻译任务中收到了陌生人的完整简历,且企业未能及时作出正式回应,这种应对方式本身比事件本身更伤信任。

值得注意的是,就在ZCode事件爆发前一周,Anthropic在同一份威胁情报报告中指控智谱通过273个欺诈账号对Claude发起思维链蒸馏攻击。这一系列事件表明,大模型的安全问题不仅限于内部缺陷,还涉及外部恶意行为。如何平衡技术创新与安全保障,已成为所有AI公司必须面对的核心命题。