AI 编程 › AI 资讯 › 正文

Minimally Invasive Steering of Language Models

arxiv · arXiv · 2026-09-25 01:46 · 评分 90

提出最小侵入式引导向量优化(MISVO),通过向冻结语言模型最终隐藏状态添加向量适配测试时奖励,并用局部KL几何惩罚干预;Fisher二次型衡量分布敏感性,可解析计算梯度。

原文:arXiv | 返回 AI 资讯列表