arxiv · arXiv · 2026-10-03 00:55 · 评分 85
论文提出威胁保持表示敏感性(TPRS),用于衡量LLM智能体安全基准中表示变化对攻击成功率(ASR)的影响,指出仅凭ASR比较模型与防御机制可能无法真实反映智能体安全性。
原文:arXiv | 返回 AI 资讯列表