杜冬冬博士详解RhymeRL,强化学习系统优化如何从历史中学习
上海交通大学副教授杜冬冬在QCon上海大会分享了其团队开发的RhymeRL系统,该系统通过利用历史生成数据优化强化学习中的Rollout阶段,相比现有方案性能提升2.6倍。文章深入解析了RhymeRL...
在人工智能技术快速发展的今天,强化学习(RL)已成为大模型对齐与推理增强的关键手段。然而,在RL训练过程中,Rollout阶段往往占据84%-91%的计算时间,成为制约效率的主要瓶颈。上海交通大学副教授杜冬冬博士在2026年QCon全球软件开发大会上海站上,详细介绍了其团队研发的RhymeRL系统,为解决这一难题提供了创新性解决方案。
杜冬冬博士指出,在大规模RL训练中,不同epoch间的Rollout存在显著的相似性。基于这一观察,RhymeRL系统采用了一系列创新设计:首先构建离线后缀树索引历史响应,实现O(m)前缀查询;其次引入奖励感知选枝机制,动态调整草稿窗口大小;最后通过奇偶步长互补调度和两级GPU资源分配策略,有效解决了在线索引开销、固定窗口验证无效以及异常长样本失衡等问题。实验结果显示,RhymeRL在端到端吞吐量方面达到基线版本的2.6倍,单步Rollout吞吐量最高提升至1.86倍。
值得注意的是,RhymeRL系统不依赖额外的小型辅助模型,而是充分利用已有RL训练过程中的历史数据。这种设计不仅避免了传统speculative decoding方法对小模型能力的依赖,还能充分挖掘和利用空闲算力,从而显著提升系统效率。杜冬冬博士强调,尽管目前该系统主要针对数学和代码任务进行了深入实践,但在更复杂的动态Agent RL场景下,可能需要进一步优化和调整。
与此同时,小米集团近期也公开了其MiMo-V2.6模型的强化学习训练过程。该模型每轮训练消耗约20亿Token,由1568个Prompt乘以16次Rollout构成,并采用完全异步的执行方式。这种大规模扩展不仅体现在计算量上,还包括环境与工具链的协同优化。小米团队通过持续增加每轮生成轨迹数量、丰富真实任务环境以及提升评分计算能力,探索RL训练的Scaling极限。
此外,中国科学院赵明阳副研究员团队提出的Kinematics-Informed Reinforcement Learning(KIRL)框架,将运动学信息内嵌进数控插补轨迹优化中,实现了加工效率提升8.0%-24%。这一成果表明,强化学习在工业领域的应用正在不断深化,从理论研究走向实际工程落地。
总体来看,RhymeRL等新一代强化学习系统的设计理念,正推动AI工程化从单纯追求模型能力向构建稳定、可信、可控的AI系统转变。随着技术的不断演进,未来AI系统将更加注重整体架构的优化,而不仅仅是单一模型的性能提升。