核心信息

腾讯研究重新审视了在线 LLM 强化学习中的临界批大小理论,表明在固定硬件上扩大批大小可提升效率。

要点

  • 在 GRPO 和 PPO 中,通过重新调整学习率,可在一定批大小范围内保持每个响应的学习效果。
  • 扩大批大小可使 PPO 生成阶段吞吐量提升高达 2.29 倍。
  • 最佳 GRPO 配置在减少 29% 的时间内达到相同的验证目标。