AI 编程 › AI 资讯 › 正文

A mechanistic study of language model introspection

arxiv · arXiv · 2026-09-28 21:13 · 评分 80

研究通过受控实验探究大语言模型如何检测和定位内部激活扰动:输入文本保持不变,要求模型报告被扰动位置或未扰动,从而揭示模型内省机制。

原文:arXiv | 返回 AI 资讯列表