核心信息
一份新开放指南提出:可在 Claude Code、Codex、OpenCode 等常用 Agent 框架内直接用强化学习训练任意模型,全程不改动任何框架或训练代码。
要点
- 同一模型在不同 Agent 框架中表现不同,因此需要面向框架的 RL 训练
- 方法无需修改框架代码或训练代码
- LFM2.5-2.6B 在四个框架上训练后从 42% 提升到 54%
- 训练过程中工具调用次数减少 31%
一份新开放指南提出:可在 Claude Code、Codex、OpenCode 等常用 Agent 框架内直接用强化学习训练任意模型,全程不改动任何框架或训练代码。