arxiv · arXiv · 2026-09-28 21:13 · 评分 80
研究通过受控实验探究大语言模型如何检测和定位内部激活扰动:输入文本保持不变,要求模型报告被扰动位置或未扰动,从而揭示模型内省机制。
原文:arXiv | 返回 AI 资讯列表