arxiv · arXiv · 2026-09-25 01:37 · 评分 86
提出ExplorationBench基准,将评估AI系统在可验证异世界中的探索能力问题可操作化,考察其提出假设、设计实验、基于结果迭代的能力,并区分真正探索与从预训练数据回忆知识。
原文:arXiv | 返回 AI 资讯列表