arxiv · arXiv · 2026-09-27 01:44 · 评分 88
论文指出临床LLM虽在医学考试中准确率高,但正确答案未必源于正确推理。作者引入三个轻量、可解释的指标来量化忠实性差距,包括衡量推理一致性的解释稳定性指数和通过概念消融检验因果性的因果忠实度评分,并认为准确性、一致性与共识度不能可靠代表LLM的推理忠实性,对医疗AI安全部署有重要意义。
原文:arXiv | 返回 AI 资讯列表