企业级Agent基础设施架构实践,安全沙箱与网络管控的落地路径

随着AI Agent从实验走向生产,企业级基础设施建设成为关键。上汽集团云计算中心架构师方宇晨在2026年QCon上海大会分享了构建安全沙箱、实现网络隔离和身份治理的实践经验,为AI Native时代...

人工智能

在AI技术快速发展的今天,企业级AI Agent正从"生成内容"向"自主执行"转变,其运行环境的安全性和可控性成为核心挑战。2026年10月22日至24日在上海举办的QCon全球软件开发大会中,上汽集团云计算中心架构师方宇晨发表了题为《企业级Agent Infra架构实践:从安全沙箱到网络管控与身份治理》的主题演讲,系统阐述了企业在构建AI Agent基础设施时的关键考量与解决方案。

方宇晨指出,AI Agent的运行环境需要同时满足文件系统和内核级别的隔离要求,传统容器隔离方案已无法满足需求。为此,他提出了基于Kubernetes Agent Sandbox的可信执行环境方案,结合gvisor/Kata支持Warm Pool、Template、Idle Reclaim、Snapshot等能力,确保运行时的高效与安全。在网络管控方面,通过OVN-Kubernetes构建多租户网络边界,实现L3/L4网络隔离;利用Istio Service Mesh配合租户级别Egress Gateway,构建L7服务访问平面,有效控制API权限。

在身份治理层面,方宇晨团队采用Keycloak建立统一的Agent身份体系,并实现了Agent凭证代理和动态凭证交换功能。这种四层隔离架构(Compute Isolation、Network Isolation、Service/API Isolation、Identity Isolation)为企业级Agent提供了完整的安全边界,解决了模型生成代码运行、复杂网络环境访问和严格权限控制等核心问题。

阿里云智能集团首席技术官李飞飞在云栖大会上强调,AI Agent的落地需要Model、Context和Harness三者的协同作用。数据流动产生智能,智能以Agent形态落进业务,业务又产生新数据和新负载,形成一个持续进化的飞轮。当前,AI基础设施正在经历从数据处理到智能体应用的全面升级,这要求企业在构建Agent基础设施时,不仅要考虑运行时隔离,还要关注网络环境、权限控制和身份治理等多个维度。

文章配图

随着AI Agent在企业中的广泛应用,其对计算资源的需求也发生了显著变化。传统的GPU推理加速模式已无法满足Agent系统的整体性能需求,大量的后续工具逻辑执行更依赖CPU的单核性能。根据阿姆达尔定律,当GPU推理速度极快时,CPU执行工具逻辑的延迟将成为整个Agent响应链条的最大瓶颈。因此,在构建大规模AI Agent基础设施时,需要综合考虑CPU、DPU、高速交换芯片以及异构GPU/NPU的协同作用,打造一个系统级的超节点算力底座。