OpenAI打造GPT-Red,用AI对抗AI提升模型安全防护

近日,OpenAI宣布推出一款名为GPT-Red的大型语言模型(LLM),这款被称为"超级黑客"的AI工具旨在通过模拟攻击来增强其他AI模型的安全性。作为OpenAI旗舰产品GPT-5.6的安全强化伙...

人工智能

近日,OpenAI宣布推出一款名为GPT-Red的大型语言模型(LLM),这款被称为"超级黑客"的AI工具旨在通过模拟攻击来增强其他AI模型的安全性。作为OpenAI旗舰产品GPT-5.6的安全强化伙伴,GPT-Red在自动化软件系统的红队测试中展现出显著优势,为日益复杂的AI应用提供了更全面的安全保障。

GPT-Red的核心功能在于自动化执行传统的红队测试,这种测试通常需要由专业团队手动完成,以识别系统中的潜在漏洞。随着AI模型变得越来越复杂,并广泛应用于代理交互、代码操作和第三方集成等场景,单纯依靠人工测试已难以应对不断扩大的攻击面。OpenAI研究科学家Nikhil Kandpal指出:"随着AI能力的提升,风险范围和影响程度都在同步扩大。"

图片

为了构建GPT-Red,OpenAI的研究团队从一个未经过专门训练的LLM开始,逐步开发出能够模拟各种攻击模式的智能体。该系统特别专注于检测一种称为"提示注入"的攻击类型,这种攻击方式允许恶意用户通过隐藏在文本中的指令,诱导AI系统执行非预期行为,例如泄露敏感信息或破坏代码结构。

OpenAI首席研究员Dylan Hunn表示:"我们希望提前设计好能够发现新型攻击模式的系统,这样当更强大的模型出现时,我们已经具备了相应的检测能力。"目前,GPT-Red已经成功识别出多种此前未被记录的攻击方法,这些发现将直接用于改进OpenAI旗下所有模型的安全防护体系。

这项技术的应用不仅限于OpenAI自身的产品,也为整个AI行业提供了一个重要的安全测试框架。随着AI技术在金融、医疗、交通等关键领域的深入应用,确保模型的安全性和可靠性已成为行业发展的核心议题之一。