Key Info
A new open guide describes a way to train any model with reinforcement learning on any task set directly inside commonly used agent harnesses (Claude Code, Codex, OpenCode) without changing a single line of harness or training code.
Highlights
- The same model behaves differently across agent harnesses, motivating harness-aware RL training
- Method works without modifying harness code or training code
- Trained across four harnesses, LFM2.5-2.6B improved from 42% to 54%
- Tool calls dropped by 31% during the training runs