#jailbreak-evaluation

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Zhida He, Xiaoyu Wen, Han Qi, Ziyuan Zhou, Peng Yu, Jiajia Li, Chaochao Lu, Qiaosheng Zhang

本文提出了一项针对大语言模型(LLM)越狱攻击评估方法的关键改进。当前大多数越狱研究仅以攻击成功率(ASR)作为唯一指标,忽略了攻击预算对结果的影响,导致不同攻击方法之间的比较缺乏公平性。已有的计算感知评估试图将异构资源统一折算为FLOPs,但在黑盒场景下难以准确估计,且无法反映特定资源约束。为此,作者引入了Fair-ASR评估协议,以共享的目标调用预算B作为统一比较轴,目标调用次数是直接可观察且与具体方法无关的度量,同时单独记录攻击者调用次数以分析效率。在Fair-ASR协议下,作者重新评估了11种代表性黑盒越狱攻击,发现攻击排名在不同目标调用预算下会发生显著变化;简单的随机扰动和手工模板在相同目标访问权限下依然极具竞争力;而所有被评估的基于LLM的攻击方法都无法在目标调用和攻击者调用两方面同时达到高效。针对这一效率缺口,作者进一步提出了ReCode,一种组合式预算高效攻击方法,其结合了脱敏重写与Fair-ASR识别出的两种低成本攻击原语。在20次目标调用预算下,ReCode在GPT-5上达到85%的ASR,平均每次请求仅需7.19次攻击者调用,展现了出色的双端效率。该研究为越狱评估提供了更科学的比较范式,并为构建高效攻击与防御策略提供了新视角。适合LLM安全研究者、红队评估人员以及模型部署方阅读。

💡 推荐理由: 当前越狱评估普遍忽视预算公平性,导致方法间排名失真。Fair-ASR引入统一的目标调用预算轴,能更客观地衡量攻击效率,为模型安全评估和对抗鲁棒性研究提供更可靠的基准。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)