AI 编程 › AI 资讯 › 正文

Tool Mediation Alters Refusal Mechanisms in Large Language Models

arxiv · arXiv · 2026-09-28 21:16 · 评分 85

论文研究工具中介如何改变 LLM 拒绝机制:通过外部工具发起的恶意交互比普通对话更难被拒绝,尽管模型表示仍编码危害信息;分析开源权重模型中的机制,为安全对齐提供方向。

原文:arXiv | 返回 AI 资讯列表