AI 编程 › AI 资讯 › 正文

LongHarness Bench: Stress-Testing Language Model Harnesses for Long-Context Reasoning

arxiv · arXiv · 2026-09-30 01:55 · 评分 86

提出 LongHarness Bench,用于评估长上下文语言模型 harness 的有效性与效率,任务需多样检索策略,弥补现有评估在区分能力上的饱和问题。

原文:arXiv | 返回 AI 资讯列表