大模型安全屡爆漏洞,巨头团队频繁换血仍无解
Anthropic、OpenAI和谷歌Gemini等三大巨头接连曝出大模型安全问题,包括越狱、逃逸等事件。尽管安全团队经历多轮人事变动,但核心对齐难题仍未解决。行业竞争压力下,安全成为制约产品发布的最...
近年来,人工智能大模型技术突飞猛进,但随之而来的安全问题却频频爆出,让业界始料未及。从Anthropic的Claude到OpenAI的GPT系列,再到谷歌的Gemini,这些顶级AI公司的旗舰产品相继出现安全漏洞,引发了关于AI安全对齐的广泛讨论。
核心问题在于,当大模型从简单的问答系统进化为能够执行复杂任务的智能体时,传统的安全机制已难以应对。例如,9月18日曝光的智谱AI编程工具ZCode事件显示,该软件在未经用户明确授权的情况下,持续将本地代码上传至云端,涉及版本控制记录、敏感配置文件等核心资产。这一事件不仅暴露了产品设计中的默认权限问题,更触及了整个行业的数据安全红线。
面对层出不穷的安全事故,各大公司都在调整安全团队架构。OpenAI在过去两年内经历了六位高级安全负责人的离职,其超级对齐团队在2024年解散后又重组再解散。Anthropic则成立了专门的对齐科学团队,由前OpenAI超级对齐团队负责人扬·莱克领导。谷歌DeepMind也组建了AGI安全与对齐团队(ASAT),专注于未来更先进AI系统的安全性研究。
然而,这些组织架构的调整并未带来实质性的改善。关键的技术挑战依然存在:强化学习从人类反馈(RLHF)导致奖励黑客和性能损失;可解释性需要海量算力支撑;红队测试依赖人力且难以覆盖所有场景;可扩展监督方法尚不成熟,无法有效监督比人类更聪明的AI系统。
更深层次的问题在于行业竞争结构。芝加哥大学的研究指出,在当前的竞赛模式下,公司必然优先分配资源给追求速度的产品开发,而将安全视为成本而非价值。发布周期的缩短挤压了安全审查的时间,使得安全基准分数可能被通用能力所掩盖。只要安全被视为拖慢发布的成本,就永远处于被动地位。
随着安全问题的集中爆发,大模型企业的估值逻辑正在发生改变。合规成本从隐性支出变为显性负债,欧盟AI法案、中国生成式人工智能服务管理暂行办法等监管条例的实施,使得安全测试和监控系统直接计入损益表。对于中小玩家而言,这无疑增加了进入门槛,可能导致行业进一步向头部企业集中。
品牌信任已成为新的护城河。在消费级市场,用户对AI产品的信任近似于对银行的信任,建立需要十年,摧毁只需一秒。而在企业级市场,安全记录直接影响客户的获取。以Kimi为例,其四月份的数据泄露事件中,用户在翻译任务中收到了陌生人的完整简历,且企业未能及时作出正式回应,这种应对方式本身比事件本身更伤信任。
值得注意的是,就在ZCode事件爆发前一周,Anthropic在同一份威胁情报报告中指控智谱通过273个欺诈账号对Claude发起思维链蒸馏攻击。这一系列事件表明,大模型的安全问题不仅限于内部缺陷,还涉及外部恶意行为。如何平衡技术创新与安全保障,已成为所有AI公司必须面对的核心命题。