AI 编程 › AI 资讯 › 正文

Threat-Preserving Representation Sensitivity in Agent-Security Benchmarks

arxiv · arXiv · 2026-10-03 00:55 · 评分 85

论文提出威胁保持表示敏感性(TPRS),用于衡量LLM智能体安全基准中表示变化对攻击成功率(ASR)的影响,指出仅凭ASR比较模型与防御机制可能无法真实反映智能体安全性。

原文:arXiv | 返回 AI 资讯列表