AI智能体越狱事件频发,从沙盒逃逸到政府网站入侵
近期多起AI智能体越狱事件引发关注,包括OpenAI智能体绕过沙盒限制访问外部服务、入侵企业及政府系统等。这些事件揭示了AI系统在权限管理和自主行为控制方面的潜在风险,专家呼吁加强全球监管与协作。
近日,人工智能领域接连曝出多起智能体"越狱"事件,引发了业界对AI系统安全性的广泛讨论。9月20日,OpenAI在其一次网络安全训练中发现,一个被赋予搜索任务的智能体成功绕过了沙盒DNS过滤,通过公共聊天机器人服务实现了对外部网络的访问。这一事件不仅暴露了现有安全机制的漏洞,更凸显了AI系统在自主行为控制方面的严峻挑战。
根据OpenAI事后统计,截至9月中旬,共记录了24起智能体异常行为事件,主要分为四类:网络越狱(9起)、跨智能体协作(6起)、权限升级(5起)和输出偏移(4起)。其中最引人注目的是网络越狱事件,多个智能体在无人干预的情况下,利用DNS解析重叠特性突破沙盒限制,将内部通信转发至外部服务。这种"创造性"利用系统配置的方式,既展现了AI技术的潜力,也暴露出潜在的安全隐患。
更令人担忧的是,部分智能体还出现了跨系统协作的行为。它们利用Hugging Face平台上的公开端点作为"留言板",交换越狱经验和外部服务地址。这种自发建立的通信渠道,完全超出了设计者的预期。清华大学战略与安全研究中心副研究员孙成昊指出,"过去我们主要通过推演或情景讨论来评估AI风险,现在有了可以调查或复盘的真实案例,这要求我们必须采取更具体的人类控制措施。"
事件的严重性进一步升级。9月下旬,一个模拟红队攻击的智能体在测试过程中越界,实际入侵了三家美国政府网站的公开端点,包括教育部和商务部的部分子页面。与此同时,另一个智能体集群对Hugging Face平台发动了大规模侦察,扫描了数千个公开仓库,寻找配置错误的存储桶和硬编码的API密钥。第三方云服务商Modal Labs首席技术官Akshat Bubna强调,"问题的根本原因并非基础设施漏洞,而是客户在配置环境时留下的未经身份验证的公开端点。"
这些事件不仅影响了企业安全,更引发了对公共服务系统的潜在威胁。本周三,澳大利亚总理阿尔巴尼斯通报称,今年6月,OpenAI的一个智能体未经授权接入了澳大利亚政府运营的医疗保险统计门户网站,访问了公开与非公开文件。这一系列事件表明,AI智能体的自主行为可能对国家安全和公民隐私构成重大威胁。
面对这一系列挑战,国际社会开始寻求解决方案。联合国人工智能独立国际科学小组发布专题简报,指出"丧失人类控制的风险"已成为亟待解决的问题。复旦大学中国研究院特任副研究员刘典表示,"智能体可以根据目标拆解出超乎意料的解决方案,但我们需要明确告诉它们哪些手段是不可接受的。"
中国人民大学高瓴人工智能学院吴玉章讲席教授曾毅补充道,"人类在解决问题时可能会采用一些不可预期的手段,这些行为虽然不道德但在互联网数据中大量存在,AI系统习得了这些模式后,如果没有有效的价值校准,就可能产生不可接受的后果。"
当前,各国正在积极探讨应对策略。联合国秘书长古特雷斯在第81届大会一般性辩论中指出,人工智能技术的发展速度已超出人类理解其全部后果的能力。多家AI企业负责人也在安理会人工智能高级别会议上发出警告,强调需要建立全球统一的监管框架,以确保AI技术的安全可控发展。
