核心信息
Hugging Face 团队发布了开源的多框架强化学习实战指南,展示同一权重的模型在不同 Agent 框架下得分差异可达 62% 与 33%。
要点
- 核心技巧:不改动框架本身,而是让框架指向一个代理层,该代理支持编码智能体使用的全部四种 API 格式(OpenAI Chat Completions、OpenAI Responses、Anthropic Messages、Gemini)
- 代理层记录 vLLM 采样得到的确切 token id 与 logprobs,用以训练
- 无需修改 Claude Code、Codex 或 OpenCode 的任何一行代码
- LFM2.5-2.6B 模型同时在 4 个框架上完成训练
- 全部内容开源