蚂蚁发布SingProbe,大模型内生式安全护栏实现边生成边识别风险

在2026年国家网络安全宣传周期间,蚂蚁AI安全实验室正式推出SingProbe大模型内生式安全护栏。该技术通过将安全检测融入模型生成过程,在保持高效响应的同时提供实时风险提示,为大模型应用落地提供了...

人工智能

随着大模型技术的快速发展,其应用场景已从实验室走向日常生活,广泛应用于日常问答、办公辅助和客户服务等领域。然而,如何确保这些AI生成内容的安全性和可靠性,成为当前亟待解决的关键问题。

针对这一挑战,蚂蚁AI安全实验室在2026年国家网络安全宣传周期间发布了SingProbe大模型内生式安全护栏。这项创新技术的核心在于将安全检测功能深度集成到模型生成过程中,实现了"边生成边识别"的风险防护机制。

SingProbe的工作原理类似于一个内置的"安全探头",它能够实时监测AI生成内容的安全性,并在生成过程中持续输出风险信号。这种设计避免了传统外置护栏模型需要额外处理待审核内容的问题,既减少了计算和部署成本,又显著提升了响应速度。

具体而言,SingProbe通过复用大模型推理过程中已经产生的内部信息,利用轻量化的安全检测模块持续输出风险分数。这意味着模型在生成回答的同时,就能给出当前内容是否存在安全或事实可靠性风险的信号,供系统及时采取告警、终止生成、重试等措施。

研发团队在Ling-3.0-flash模型生产环境中的实测数据显示,SingProbe在解码阶段引入的额外开销低于0.5%。同时,该技术在回答安全分类和流式安全检测任务上表现优异,超过所选公开基线;在幻觉检测任务上与参考基线基本持平,为兼顾检测能力与运行效率提供了新的技术路径。

为了更贴近实际应用,研究团队还同步发布了评测基准SingStreamBench。该基准重点关注模型从正常回答转向风险内容的具体时刻,不仅检验护栏能否发现风险,还考察是否过早触发、发现是否及时,从而以更贴近实际的方式衡量安全防护效果。

在特定场景应用方面,研究团队进一步探索了SingProbe-Med技术。该技术通过持续监测生成过程中的医疗风险,仅在达到触发条件后对局部高风险内容进行解码干预。根据在AntAngelMed-100B上的医疗评测结果,完整干预能够纠正基线模型中25.03%原本出错的回答,展示了内生风险信号用于生成过程安全控制的巨大潜力。

目前,SingProbe已适配包括Ling-3.0系列、GLM-5.2/5.3、Qwen、DeepSeekV4在内的29个主流开源大模型,并接入SGLang、vLLM推理框架。相关代码、模型和评测基准均已开源,预计未来将进一步扩展对更多开源模型的支持,推动安全防护更紧密地融入大模型推理与部署流程。

SingProbe技术展示

与此同时,天融信也在此次网络安全宣传周期间取得了重要进展。作为首批获得《人工智能防火墙产品测评》证书的企业,天融信的人工智能防火墙率先通过T/CCIA 006-2026标准测试。该产品不仅支持透明代理与反向代理两种部署模式,还具备AI应用层深度防护、AI攻击智能防护、AI安全审计与可视化等多项核心功能,为大模型服务提供了全方位的安全保障。