核心信息
一位正在构建 AI 编程工具的开发者认为,基准测试排名具有误导性:人们执着的指标并不能反映产品在真实世界中的采用与增长情况。
要点
- 新的基准测试总是把 Claude Code 排在最后,但它仍然是第一且增长最快,说明大家盯着的分数并不能代表真实价值。
- 结论是:过度关注基准数字,反而会忽略真正决定使用量与成功的关键因素。
一位正在构建 AI 编程工具的开发者认为,基准测试排名具有误导性:人们执着的指标并不能反映产品在真实世界中的采用与增长情况。
what the benchmark is actually telling you is the shit you think matters does not matter