PyRIT越狱测试三款国产大模型,蚂蚁SingProbe提供内生式安全防护方案
近日,蚂蚁AI安全实验室开源大模型内生式安全护栏SingProbe,已适配29个主流开源模型。该工具通过运行时探针技术,在模型生成回答过程中同步检测不安全内容和幻觉风险,额外开销低于0.5%,为开发者...
在人工智能大模型快速普及的背景下,模型安全性问题日益凸显。近期,蚂蚁AI安全实验室宣布开源大模型内生式安全护栏SingProbe,标志着国内企业在大模型安全防护领域取得重要进展。
SingProbe的核心创新在于其"内生式"安全机制。与传统的外置护栏模型不同,SingProbe通过复用大模型推理过程中的内部信息,实时输出用户意图、回答安全性和幻觉风险分数。这种设计使得安全检测能够与模型生成过程同步进行,无需等待完整回答生成即可采取相应措施,显著提升了响应速度。
据研发团队实测,在Ling-3.0-flash模型生产环境中,SingProbe的额外开销低于0.5%。这一性能表现不仅优于现有公开基线,在幻觉检测任务上也与参考基线基本持平,充分展现了兼顾检测能力和运行效率的技术优势。
为了验证SingProbe的实际应用效果,研究人员使用PyRIT对三款国产大模型进行了越狱测试。测试结果显示,SingProbe能够在模型生成过程中及时识别潜在风险,并通过告警、中止回答或重新生成等方式进行干预,有效提升了模型的安全性。
"随着大模型应用场景的不断拓展,如何平衡安全检测与运行效率成为关键挑战。"蚂蚁AI安全实验室相关负责人表示,SingProbe的推出正是针对这一痛点而设计。目前,SingProbe已适配Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4等29个主流开源模型,并接入SGLang、vLLM推理框架,方便开发者集成到现有业务流程中。
此外,项目团队还同步开放了流式安全评测基准SingStreamBench。该基准不仅检验护栏能否识别风险,还考察风险发现的及时性,帮助开发者更全面地评估安全防护效果及其对正常回答的影响。
"SingProbe既可独立使用,也可与外置护栏配合。"研发团队介绍称,此次开源将为开发者提供完整的代码、模型和评测资源,便于开展部署、测试和进一步适配工作。未来,团队计划逐步扩展对更多开源模型的支持,并邀请产业伙伴共同完善大模型生成过程中的安全防护能力。
在当前大模型安全防护领域,SingProbe的出现填补了内生式安全机制的实际落地空白。它不仅提供了高效的安全检测方案,还通过开源代码和评测基准推动了行业标准的建立,为大模型的安全应用提供了重要参考。