arxiv · arXiv · 2026-09-27 01:28 · 评分 80
针对临床LLM评测只重准确率的问题,提出反事实有效性与人口统计鲁棒性测试。在150道MedQA题目上评估六个LLM,检验模型在最小临床改动下能否保持逻辑一致性,以及不同人口统计前缀下的表现差异。
原文:arXiv | 返回 AI 资讯列表