核心信息

TRL v1.15 正式发布,官方称这是该项目迄今最大的一次优化,默认启用融合 LM Head。

要点

  • 峰值显存占用最高降低 82%
  • 可训练序列长度提升至 7 倍
  • DPO 的 token 容量从 1 万提升到 5.9 万
  • GRPO 的 token 容量从 2.9 万提升到 11.5 万