arxiv · arXiv · 2026-10-02 01:57 · 评分 78
论文提出,语言模型消融后表现出的“自我修复”并非补偿机制,而是在消融前就存在的增益被放大。任何对关键组件的干预都可视为有符号强度轴上的一个点,从而用统一框架解释该现象,挑战以往“无单一解释”的结论。
原文:arXiv | 返回 AI 资讯列表