AI 编程 › AI 资讯 › 正文

Beyond Accuracy: Counterfactual Fragility and Demographic Bias in Clinical Evaluation of LLMs

arxiv · arXiv · 2026-09-27 01:28 · 评分 80

针对临床LLM评测只重准确率的问题,提出反事实有效性与人口统计鲁棒性测试。在150道MedQA题目上评估六个LLM,检验模型在最小临床改动下能否保持逻辑一致性,以及不同人口统计前缀下的表现差异。

原文:arXiv | 返回 AI 资讯列表