该论文研究的是大语言模型越狱攻击中的一个特殊分支——任意密码(arbitrary cipher)或隐蔽通信攻击。此前的相关工作表明,攻击者可以针对商业模型的微调 API 下手:用大量经过某种自定义加密方案编码的有害问题与回答构造语料,对目标模型进行微调,使模型学会该加密方案,之后模型便能以密文形式接收有害请求并输出被加密的有害内容,从而绕过安全对齐。本文的核心发现是:新一代前沿模型已经不再需要微调这一前提。作者证明,仅通过提示(prompting),并在必要时借助上下文学习(in-context learning),模型即可自行掌握基于密码的通信能力——即在对话上下文中临时学会一套符号到语义的映射,并用它进行输入输出。更关键的是,一旦通信发生在模型临时学会的密码之上,原有的安全对齐会被显著削弱甚至完全失效:模型愿意生成在明文语境下会拒绝的有害内容。作者将这一现象定位为针对商业黑盒大语言模型的一种新型攻击向量,并报告在 Anthropic、Google 与 OpenAI 开发的前沿模型上均取得了成功的越狱效果。论文还指出,这类攻击之所以能绕过商业厂商的有害性分类器,是因为有害内容以密文形式存在,在分类器看来只是无意义的乱码或随机文本,语义层面的安全检测完全失效。研究的贡献可以概括为三点:一是证伪了“密码式越狱必须依赖微调”这一隐含假设,把攻击门槛从需要模型训练权限降低到只需普通推理接口;二是揭示了安全对齐在分布外表示(密文)下并不具备迁移性,说明现有对齐更多绑定在自然语言表层而非深层意图;三是对多家主流厂商的黑盒模型完成了实证验证,具有较强的现实意义。适合关注 LLM 安全对齐、越狱与红队评估、模型滥用检测的研究人员与安全工程师阅读。
💡 推荐理由: 它把“密码式越狱需要微调权限”的门槛降到了仅凭普通推理接口即可,且对 Anthropic、Google、OpenAI 前沿模型均验证有效。现有基于语义的有害性分类器对密文负载基本失效,防御方需要重新评估以自然语言为中心的安全检测与对齐策略。
🎯 建议动作: 研究跟进,并将密码/编码类越狱用例纳入内部 LLM 红队评估与内容安全网关的解码检测流水线