腾讯研究:扩大批大小可提升在线 LLM 强化学习效率 Tencent Hy Tencent Hy @TencentHunyuan Tencent's foundation model for text, image, video, and 3D generation. 1 小时前 核心信息 腾讯研究重新审视了在线 LLM 强化学习中的临界批大小理论,表明在固定硬件上扩大批大小可提升效率。 要点 在 GRPO 和 PPO 中,通过重新调整学习率,可在一定批大小范围内保持每个响应的学习效果。 扩大批大小可使 PPO 生成阶段吞吐量提升高达 2.29 倍。 最佳 GRPO 配置在减少 29% 的时间内达到相同的验证目标。 本篇整理自 1 条推文 ⚡️ As LLM reinforcement learning scales to larger GPU cluste… #AI#大语言模型#强化学习 ← 上一篇 GMI Cloud 在 SemiAnalysis ClusterMAX 3.0 中获评银级 下一篇 → 腾讯研究:扩大批大小提升在线 LLM 强化学习训练效率 点赞 0 分享