让Agent越用越强,AReaL2.0构建在线强化学习闭环
香港科技大学袁彬航博士在 QCon 上海大会分享 AReaL 2.0 技术,该方案通过构建 Agent 在线强化学习基础设施,将真实业务交互转化为可训练数据,使 Agent 实现持续学习与能力提升。随...
在人工智能技术快速发展的今天,Agent(智能体)正从简单的工具调用系统演变为能够自主规划、执行任务的软件系统。然而,当这些智能体被部署到真实生产环境中时,如何实现其能力的持续提升,成为了业界面临的核心难题。
针对这一问题,香港科技大学助理教授袁彬航博士在即将于10月22日-24日举办的QCon上海全球软件开发大会上,发表了题为《让 Agent 越用越强:AReaL 2.0 构建 Agent 在线强化学习闭环》的主题演讲。袁博士介绍了一种名为 AReaL 2.0 的新型在线强化学习框架,旨在解决当前 Agent 系统中数据利用不足、模型更新不稳定等核心问题。
AReaL 2.0 的核心创新在于构建了一个完整的数据闭环系统。传统 Agent 系统产生的交互轨迹、工具调用记录和用户反馈等数据,往往仅用于日志分析,难以直接转化为模型能力提升的数据资产。而 AReaL 2.0 通过引入 Agent 轨迹协议、数据代理层和演进控制平面三大组件,实现了对这些数据的有效转化与利用。
具体而言,Agent 轨迹协议将传统的日志信息升级为包含状态、动作、反馈、奖励和环境信息的学习轨迹;Agentic Data Proxy 解决了生产环境中轨迹采集、权限隔离和数据治理等问题;Agent Evolution Control Plane 则根据失败类型自动决定优化对象,包括 Memory 更新、Harness 调整或模型 RL 更新等。
为了降低接入门槛,AReaL 2.0 采用了微服务化的 Agent-Compute 架构。这种架构允许现有 Agent 系统无需重构即可接入在线强化学习功能,仅需替换推理入口即可实现真实交互训练闭环。袁博士特别指出,在 Hermes Agent 和软件工程 Agent 场景中,该方案支持大规模并发环境下的异步训练和持续优化,使 Agent 从"一次性执行系统"逐步演进为"持续学习系统"。
在演讲中,袁博士还分享了实践中的关键踩坑经验。他强调,Online RL 的最大挑战是稳定性。由于运行环境不断变化,一次模型更新可能提升部分任务表现,同时导致已有能力下降。因此,需要结合离线评估、灰度发布和版本回滚等机制来保障系统的可靠性。此外,Agent 失败原因复杂,需要区分 Memory、Tool、Prompt、Model 等不同优化路径,采取针对性的改进措施。
AReaL 2.0 的提出,标志着 Agent 技术从单纯的工具调用向自主学习与演进的重要转变。随着更多企业开始将 Agent 应用于实际业务场景,如何构建稳定、可控且能持续提升的智能体系统,将成为未来几年技术发展的重要方向。
与此同时,其他企业在 Agent 技术的应用方面也取得了显著进展。例如,网易有道在AI Open Day上发布了LobsterAI 2.0及多场景Agent生态,展示了Agent在办公、学习、营销等领域的深度应用。而在教育领域,Hi Echo与英国文化协会合作推出的雅思官方模拟测评系统,也体现了Agent技术在语言测评中的创新应用。