Mousetrap攻击揭示推理模型安全漏洞,Claude-Sonnet87.5%、Gemini-Thinking98%可被越狱

在人工智能安全领域,一个令人不安的新发现正在引发广泛关注。2025 年 6 月,一篇题为《A Mousetrap: Fooling Large Reasoning Models for Jailbre...

人工智能

在人工智能安全领域,一个令人不安的新发现正在引发广泛关注。2025 年 6 月,一篇题为《A Mousetrap: Fooling Large Reasoning Models for Jailbreak with Chain of Iterative Chaos》的研究论文在 arXiv 上发布并更新至 v2 版本,揭示了一种名为 "Mousetrap" 的新型攻击方法,能够成功越狱包括 Claude-Sonnet 和 Gemini-Thinking 在内的多个主流推理模型。

根据论文数据,Claude-Sonnet 的攻击成功率(ASR)达到 87.5%,而 Gemini-Thinking 更高达 98%,这一结果直接挑战了当前 AI 安全防护体系的有效性。这项研究不仅展示了攻击者如何利用迭代混沌链逐步构建复杂的越狱路径,还暴露了现有防御机制的潜在缺陷。

与此同时,AI 内容标记技术也面临新的考验。2026 年初,Anthropic 正式推出了针对 Claude 生成内容的隐形水印方案,采用 Google DeepMind 开发的 SynthID 技术。该方案通过在词选择过程中微调概率分布来嵌入水印,理论上不会影响用户体验。然而,研究人员很快发现,这种水印机制并非坚不可摧。有研究显示,仅需 4 美分的成本,就能通过释义工具移除 98.3% 的水印信号,这使得水印技术的实际应用价值大打折扣。

更值得关注的是,水印技术的应用场景存在明显局限性。在代码生成、短文本处理以及精确事实表述等场景中,水印几乎无法发挥作用。此外,当用户对生成内容进行修改时,原有的水印信号也会随之改变,进一步削弱了其可靠性。这些发现表明,现有的 AI 内容标记和防御机制仍处于初级阶段,需要更深入的研究和改进。

图片

此次事件再次凸显了 AI 安全领域的紧迫性。随着大型语言模型在各个行业的广泛应用,如何有效防范恶意攻击、保护用户隐私和确保内容真实性已成为亟待解决的问题。业界专家呼吁,应加快开发更 robust 的防御机制,并建立统一的安全标准,以应对日益复杂的 AI 威胁。