从Rollout到权重同步,Mooncake如何支撑高性能强化学习系统

在 2026 年 QCon 上海大会上,Mooncake 社区 Maintainer 马腾博士分享了其项目如何通过优化数据面和权重更新机制,解决强化学习系统中的性能瓶颈。Mooncake 提供了结构化...

人工智能

在人工智能技术快速发展的今天,强化学习(Reinforcement Learning, RL)作为 AI 的重要分支,正在从实验室走向实际应用。然而,RL 系统的性能提升不仅依赖于模型训练本身,还面临着 Rollout 数据传输、经验回放和权重同步等多方面的挑战。

2026 年 10 月 22 日至 24 日在上海举办的 QCon 全球软件开发大会中,Mooncake 社区 Maintainer 马腾博士发表了题为《从 Rollout 到权重同步:Mooncake 如何支撑高性能强化学习系统》的主题演讲。马腾博士指出,当前 RL 系统的主要瓶颈包括:大规模复杂结构化的 Rollout 数据传输开销高、Actor 与 Learner 之间的数据传输容易阻塞、权重更新频繁且成本高昂,以及 MoE 模型权重同步的高成本等问题。

针对这些挑战,Mooncake 提供了一套完整的高性能 RL 数据面解决方案。首先,在数据面方面,Mooncake 通过引入 DataProto 和 typed-ragged 数据组织方式,有效支持变长序列数据;利用 BufferPool 降低内存分配和拷贝开销;并通过 RDMA 技术加速 Rollout 数据传输。此外,Mooncake 还接入 Miles 替代 Ray Object Store,支持同步和 Fully Async 两种执行模式,实现了数据生产、消费和缓存的并行化处理。

在权重更新机制上,Mooncake 同时支持 NCCL Broadcast、TransferEngine P2P RDMA 和 disk-delta 三种方案。其中,P2P RDMA 方案在 Kimi-K2 场景中约实现 7 倍加速。同时,Mooncake 还支持 TP/PP/EP/DP 异构 Reshard、Store 权重快照及 MoE 稀疏 Delta 等功能,为大规模 RL 训练提供了强大的数据与权重基础设施。

马腾博士进一步介绍了 Mooncake 在异构并行方面的支持能力。项目已成功接入 vLLM、SGLang、TRT-LLM、Dynamo 等多个社区,并已在阿里云、清华、月之暗面、蚂蚁、字节、小红书、趋境科技等多方参与下,实现了在 Miles、SGlang、vLLM 生产生态的落地。

QCon 大会作为全球软件开发领域的顶级盛会,每年都会汇聚来自世界各地的技术专家和产业实践者。本次上海站聚焦 Harness AI 时代的工程实践,围绕 AI Native 架构、Agent Runtime、AI Infra、Data Systems、Agent 安全与可观测、Loop Engineering、Vibe Coding、具身智能与世界模型、端云协同等多个前沿技术方向展开深入探讨。

图2

在 RL 系统中,数据流和控制流的分离是实现高性能的关键。Mooncake 通过将数据流与控制流解耦,实现了 Actor、Rollout 和 Learner 之间的高效协作。在 Fully Async 模式下,数据生产、消费和缓存可以并行进行,从而在吞吐、延迟与训练稳定性之间取得最佳平衡。

为了应对大规模 RL 训练中的网络拥塞问题,Mooncake 还借鉴了 RoCEv2(RDMA over Converged Ethernet version 2)的技术原理。RoCEv2 是对传统 RoCE 协议的扩展,通过 IP 路由实现无损传输,特别适合数据中心内的高性能计算场景。

图3

在具体操作码(OpCode)层面,RoCEv2 定义了一系列可靠的连接(Reliable Connection, RC)操作,如 SEND First、SEND Middle、SEND Last 等,确保数据传输的可靠性和顺序性。

总的来说,Mooncake 通过系统级优化和技术创新,为高性能强化学习系统提供了一个全面的解决方案。随着 AI 技术的不断发展,相信像 Mooncake 这样的基础设施项目将在推动 AI 从实验到生产的过程中发挥越来越重要的作用。