核心信息
腾讯的新研究将经典临界批大小理论扩展到在线 LLM 强化学习,证明在有限的批大小范围内,通过调整学习率可以保持每个响应的学习效果,从而在固定硬件上提升训练效率。
要点
- 在固定硬件上,扩大批大小可将 PPO 生成阶段吞吐量提升至 2.29 倍。
- 最佳配置的 GRPO 达到相同验证目标的时间缩短 29%。
- 研究结果适用于 GRPO 和 PPO,涵盖 rollout 生成与训练规模差异。
腾讯的新研究将经典临界批大小理论扩展到在线 LLM 强化学习,证明在有限的批大小范围内,通过调整学习率可以保持每个响应的学习效果,从而在固定硬件上提升训练效率。