AI 编程 › AI 资讯 › 正文

Distillation Defenses Easily Break After Reinforcement Learning

arxiv · arXiv · 2026-09-29 01:40 · 评分 85

研究发现现有蒸馏防御在攻击者继续强化学习后容易失效,质疑防御评估的静态假设,提示需考虑后续训练以保障闭源模型能力不被复制。

原文:arXiv | 返回 AI 资讯列表