Key Info

Requesty benchmarked 22,000 decisions across 3 decision models and 8 LLMs on human-labeled gateway tasks, comparing accuracy against cost.

Highlights

  • Clef (27B) achieved 83.2% accuracy at $0.13 per 1K items
  • Opus 5.5 achieved 86.6% accuracy at $3.80 per 1K items
  • Opus 5.5 is ~29x more expensive per 1K items for a ~3.4 point accuracy gain
  • Test set covers human-labeled gateway routing decisions