推荐 5.5
Conf: 50%
本文针对大型语言模型(LLM)在安全审核机制下仍可被提示词越狱(jailbreak)的问题,提出了一种名为 RoguePrompt 的多阶段攻击流水线。研究背景是:尽管主流 LLM 部署了内容审核与安全控制,攻击者仍可通过精心构造的提示词绕过策略限制。已有工作提出了密码中介交互、代码嵌入解密、提示分解与重构、分层自定义加密等攻击原语,但既有评估通常将可见接受、隐藏请求成功恢复以及后续执行合并为一个总体攻击成功率,缺乏对多阶段提示转换在可观察黑盒交互中具体失败环节的细粒度证据。RoguePrompt 的核心方法是:将一个被禁止的提示词进行分割,并应用两层嵌套编码(Vigenere 后接 ROT13),同时加入自然语言重构指令。该流水线在黑盒威胁模型下开发与评估,仅通过 API 或用户界面访问所托管的模型,并在 313 个真实世界中被硬拒绝的提示词上测试。作者分别度量了审核绕过、指令重构和执行三个阶段是否达到各自自动化标准。实验结果显示,平均成功率为:过滤器绕过 93.93%,重构 79.02%,执行 70.18%。这些结果表明分层提示编码的有效性,同时提供了阶段级证据,展示多阶段越狱在审核绕过、指令重构和执行环节中分别可能失败的位置。该研究为理解黑盒 LLM 越狱的机理提供了更细致的视角,有助于防御方针对性地设计缓解措施。
💡 推荐理由: 该研究揭示了现有 LLM 审核机制在多层编码攻击面前的脆弱性,且提供了阶段级成功率数据,帮助安全团队识别最薄弱的环节,优先投入防御资源。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)