核心信息

团队发布 ExplorationBench,一个专注于衡量 AI 系统如何在已知问题之外进行探索的新基准。

要点

  • 科学发现需要提出假设、设计实验并从结果中学习
  • 评估真正的新颖性很困难,因为全新的答案缺乏直接的核验方式
  • 该基准关注 AI 系统的探索能力,而非标准任务表现