AI 编程 › AI 资讯 › 正文

ExplorationBench: Measuring AI Systems' Exploration in Verifiable Alien Worlds

arxiv · arXiv · 2026-09-25 01:37 · 评分 86

提出ExplorationBench基准,将评估AI系统在可验证异世界中的探索能力问题可操作化,考察其提出假设、设计实验、基于结果迭代的能力,并区分真正探索与从预训练数据回忆知识。

原文:arXiv | 返回 AI 资讯列表