核心信息

TypeSafe AI CEO @CompleteSkeptic 解释为何公开评测 Jev 极易被操纵并完全错失重点:Jev 旨在软件内部做可靠决策,核心是 RLCD(可靠低成本决策),而非聊天优先式 AI。

要点

  • 他警告不要搞“Jevbench”或追逐公开基准,认为这会转移对 Jev 真正目标的关注。
  • 强调选对任务比操纵指标更有价值,这是他最惨痛的教训之一。
  • 将 Jev 定位为聊天优先式 AI 的终结,聚焦软件决策可靠性而非原始分数。