AI 编程 › AI 资讯 › 正文

TRACE: Trajectory Return Attribution and Contrastive Erasure for Multi-Turn Safety

arxiv · arXiv · 2026-10-01 16:49 · 评分 84

提出TRACE方法,研究多轮对话中安全对齐失效:模型单轮拒绝但把同一有害目标拆到多轮就可能遵从。给出单轮监督抑制可约束多轮轨迹风险的充分条件,涉及覆盖率、迁移余量和泄漏,并引入轨迹回报归因与对比擦除。

原文:arXiv | 返回 AI 资讯列表