arxiv · arXiv · 2026-10-06 18:06 · 评分 88
论文提出SpeedrunBench,用视频游戏速通挑战评测LLM Agent能否在人类已解决的复杂问题上开发出新策略,探索智能体超越既有人类解决方案的战略能力,具有较强的评测价值。
原文:arXiv | 返回 AI 资讯列表