该论文针对大型语言模型(LLM)面临的越狱攻击问题,提出了一种名为 AlcaTRAz(Anchored Tree-Rule defense Against jailbreaks)的提示词级别防御方法。越狱攻击通过精心构造的输入绕过模型的安全对齐,而现有防御大多依赖访问模型权重或内部状态,难以应用于黑盒部署场景。AlcaTRAz 仅操作输入文本,无需修改或重训练目标模型,因此可适配黑盒 API 服务。其核心思想是自动学习一种可迁移的变换规则,在选定位置插入受控的字符级扰动,从而破坏越狱攻击所依赖的结构规律,同时在良性查询上尽量保持模型的原始功能。作者在 33 个开源权重模型、22 种越狱攻击类型以及一个短单轮良性问题基准上进行了评估,并与三种代表性的提示词级别基线防御(Llama Guard、RA-LLM、Goal Prioritization)进行对比。结果显示,AlcaTRAz 在 73.4% 的模型-攻击组合中取得了最佳的综合安全性与功能性得分;在未防御情况下,聚合分数众数为 10(对恶意请求给出最大严重性响应),而采用 AlcaTRAz 后下降到 2(接近拒绝回答)。同时,良性查询的平均得分仅从 8.62 降至 8.35(0-10 量表),差距在 0.27 分以内。尽管 AlcaTRAz 显著降低了越狱成功率,但并未完全消除,仍存在高严重性残留,且未考虑自适应攻击者。因此论文将 AlcaTRAz 定位为深度防御体系中的一个环节,而非独立保证。该工作适合 LLM 安全研究者、红蓝队人员以及需要部署轻量级输入防御的工程团队阅读。
💡 推荐理由: 对蓝队而言,提供了一种无需访问模型内部、仅靠输入变换就能缓解越狱的轻量方案,适合黑盒 LLM 服务;同时强调防御并非一劳永逸,需结合深度防御策略。
🎯 建议动作: 研究跟进