arxiv · arXiv · 2026-10-06 17:19 · 评分 84
一项实证研究分析了幻觉检测基准中的标注问题:先让LLM在开放域问答集上生成答案,再用自动标注策略与参考答案比对判定是否幻觉。研究揭示不同标注策略对评估可靠性的影响,提醒基准结果需谨慎解读。
原文:arXiv | 返回 AI 资讯列表