arxiv · arXiv · 2026-10-01 16:49 · 评分 84
提出TRACE方法,研究多轮对话中安全对齐失效:模型单轮拒绝但把同一有害目标拆到多轮就可能遵从。给出单轮监督抑制可约束多轮轨迹风险的充分条件,涉及覆盖率、迁移余量和泄漏,并引入轨迹回报归因与对比擦除。
原文:arXiv | 返回 AI 资讯列表