核心信息
腾讯混元、复旦大学与清华大学研究人员发布 ExplorationBench,用于衡量 AI 系统的探索能力,基于规则可执行、且与常识相冲突的“异世界”沙盒构建。
要点
- 基准面向科学发现能力:提出假设、设计实验、从结果中学习
- 异世界规则可执行,因此每个答案都能被精确校验
- 规则刻意与常见知识冲突,仅靠记忆无法解题
- 包含两个沙盒:AlienCode 含 31 条隐藏规则(原文后续截断)
腾讯混元、复旦大学与清华大学研究人员发布 ExplorationBench,用于衡量 AI 系统的探索能力,基于规则可执行、且与常识相冲突的“异世界”沙盒构建。