AI供应链漏洞,顶级模型推理链被低成本解码,安全治理再受挑战
在人工智能技术快速发展的今天,模型推理过程的安全性已成为行业关注的焦点。近日,一项由马克斯·普朗克智能系统研究所等机构联合发布的研究报告彻底打破了业界对顶级闭源模型安全性的固有认知。 该研究详细披露了...
在人工智能技术快速发展的今天,模型推理过程的安全性已成为行业关注的焦点。近日,一项由马克斯·普朗克智能系统研究所等机构联合发布的研究报告彻底打破了业界对顶级闭源模型安全性的固有认知。
该研究详细披露了当前三大前沿AI模型厂商(Anthropic、OpenAI、Google)的API中普遍存在严重的密码学旁路漏洞。通过实验验证,研究人员发现仅需使用一款基础模型,就能从加密推理块中恢复并转录出顶级大模型原本被隐藏的思维链数据。这种"降维提取"技术路径的核心在于证实了加密思维数据包的"跨环境可移植性",即这些数据不仅能够脱离原始上下文进行重放,更能在同一厂商的不同参数量级模型之间无缝转移。
"这很可能成为今年最有影响力的科学论文之一。"知名AI研究员Nathan Lambert评价道。Meta FAIR实验室的研究科学家Arman Zharmagambetov也对此表示高度认同。研究团队完整演示了这种攻击流程:首先捕获高级模型产生的加密推理块,然后将加密块注入低级模型并实施越狱,最终以明文重构出原始推理过程。
这一发现不仅意味着模型能力的秘密可能被低成本蒸馏,更可能导致大规模隐私泄露、有害信息提取以及隐形提示注入,动摇整个AI智能体生态的信任基础。尽管部分厂商此前已意识到潜在风险,并采取了加密措施,但研究表明这些防护手段并未能有效阻止攻击。
"当安全性与产品设计、商业模式发生冲突时,前沿模型厂商究竟会把安全放在什么位置?"未尽研究在评论中指出,这一漏洞暴露出的问题远不止技术层面,更涉及商业秘密与安全机制之间的复杂权衡。一旦加密思维链被弱模型重新解码,模型厂商将失去原本以为可以控制的安全边界,以及对模型内部行为的监督优势。
随着AI技术在各领域的深入应用,供应链安全问题的重要性日益凸显。此次研究不仅为AI安全领域敲响了警钟,也为后续的安全治理提供了重要参考。业界普遍认为,公开全部思维轨迹构建多元监督机制,可能是解决这一问题的有效途径之一。