GRPO长程Agent失效,NVIDIAFlashREINFORCE提出新解法
针对 GRPO 在长程 Agent 场景下因组同步和采样成本问题导致效率低下的困境,NVIDIA 提出 FlashREINFORCE 方案。该方案通过每 prompt 仅采一条轨迹、引入三个组件压住梯...
在强化学习(RL)领域,Group Relative Policy Optimization(GRPO)作为一种优雅的策略优化方法,曾因其无需价值网络和 GAE 的特性,在数学题等任务上表现出色。然而,当 GRPO 被应用于更复杂的长程 Agent 场景时,其设计中的两个隐含假设被证明难以满足,导致性能大幅下降。
GRPO 的核心优势在于利用组内相对优势估计来替代传统的 critic 网络。这种方法在数学题场景中表现良好,因为同一 prompt 的多次采样成本较低,且生成的轨迹长度分布集中。但在 Agent 场景下,单次 rollout 可能包含数百次工具调用,耗时从几秒到几十分钟不等,且分布极不均匀。这种情况下,GRPO 的组同步机制成为瓶颈:整个组必须等待最慢的那条轨迹完成才能计算基线,导致大量 GPU 资源闲置。
为解决这一问题,NVIDIA 提出了 FlashREINFORCE 方案。该方案的核心思想是彻底放弃 GRPO 的组结构,改为每个 prompt 仅采一条轨迹,并采用到达即批(arrival-batch)的方式处理。具体而言,FlashREINFORCE 不再等待组内所有 rollout 完成,而是将最先到达的 rollout 直接进行批量处理。这种设计避免了组同步屏障,显著提升了训练效率。
为了在去除组结构和 critic 网络的情况下保持稳定性,FlashREINFORCE 引入了三个关键组件:One-Batch REINFORCE、Sequence Trust Region 和 Sample-Mean Optimization。这些组件共同作用,有效控制了梯度噪声,使得模型能够在异步延迟 4-8 的条件下稳定运行 6000 次更新。实验表明,在某些场景下,GRPO 对照组在第 600 步时工具调用次数已归零,而 FlashREINFORCE 则能持续优化模型性能。
此外,FlashREINFORCE 还解决了 GRPO 中 prompt 覆盖被稀释的问题。在相同的 rollout 预算下,GRPO 的 64×8 配置只能覆盖 64 个不同任务,而 FlashREINFORCE 的每 prompt 一条轨迹配置可以覆盖 512 个不同任务。这对于长程 Agent 尤其重要,因为 Agent 的能力依赖于对多种任务形态的广泛覆盖,而非单一任务的深度探索。
总的来说,FlashREINFORCE 为长程 RL 提供了一种新的解决方案,它通过简化采样结构和引入创新的优化组件,在保持高效训练的同时,显著提升了模型的泛化能力和适应性。这一研究不仅推动了 RL 技术的发展,也为实际应用中的复杂任务提供了更可行的实现路径。