arxiv · arXiv · 2026-10-07 01:57 · 评分 84
BOTTLED基准测试检验LLM智能体能否将通用能力转化为特定任务的廉价可扩展解决方案,在给定无标签工作负载和固定时间预算下平衡回答质量与摊销成本。
原文:arXiv | 返回 AI 资讯列表