Key Info

A new open guide describes a way to train any model with reinforcement learning on any task set directly inside commonly used agent harnesses (Claude Code, Codex, OpenCode) without changing a single line of harness or training code.

Highlights

  • The same model behaves differently across agent harnesses, motivating harness-aware RL training
  • Method works without modifying harness code or training code
  • Trained across four harnesses, LFM2.5-2.6B improved from 42% to 54%
  • Tool calls dropped by 31% during the training runs