#jailbreak-defense

共收录 12 条相关安全情报。

← 返回所有主题
👥 作者: Aashiq Muhamed, Mona T. Diab, Virginia Smith

开放权重语言模型的安全护栏可被"拒绝特征消融"(Refusal Feature Ablation, RFA) 轻易绕过:该技术通过对比估计器在模型残差流中定位出一条线性"拒绝方向",并将其投影剔除,从而在几乎不损失模型通用能力的前提下获得很高的攻击成功率 (ASR)。针对这类攻击的传统防御通常需要对每一个新的模型检查点进行安全微调,计算成本高昂、难以规模化。本文提出"诱饵方向优化"(Decoy Direction Optimization, DDO),一种快速的事后权重编辑防御,无需对基座模型做任何微调。其核心机理洞察是:消融攻击依赖对比估计器来寻找拒绝方向,因此与其试图隐藏真实的拒绝回路,不如主动向网络 MLP 神经元中注入一个高幅值、非线性的诱饵信号。当攻击者尝试定位拒绝方向时,该诱饵会污染其估计器,诱导攻击者错误地消融一个无害的正交特征,而真实的安全机制仍保持完好。作者进一步给出了刻画这一效应的形式化谱界 (spectral bound) 证明。实验方面,DDO 在六个模型家族上进行了评估,在标准 RFA 攻击下 ASR 低于 10%;在 Llama-3-8B-Instruct 上,面对自适应多阶段攻击,DDO 与经过训练的防御基线表现相当(最坏情况 ASR 65% 对 58%),并将 Heretic 权重级攻击的 ASR 从 88.7% 降至 18%,而每配置的优化成本仅为训练式基线的 1/30 至 1/450。

💡 推荐理由: 开放权重模型一旦发布,任何人都能对权重做后处理,消融类攻击成本极低,而传统防御需逐检查点微调,难以规模化。DDO 提供了一种低成本事后加固路径,对模型发布方、模型托管平台与下游部署团队有直接工程价值,也提出"防御即扰动攻击者估计器"这一新范式。

🎯 建议动作: 研究跟进,并纳入内部模型发布安全评估流程试点

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Qi Wang, Chengcheng Wan, Jiangtao Wang

本文提出 SRD-GUARD,一种面向大语言模型(LLM)的免参数、黑盒防御框架,用于对抗越狱(jailbreak)攻击。越狱攻击常通过角色扮演、虚构场景或看似合理的动机隐藏有害意图,现有推理时防御要么漏掉伪装攻击,要么过度拒绝合法请求。SRD-GUARD 的核心思路是“语义重写 + 共识风险评分”:首先对输入提示词生成 5 个语义等价的改写版本,这些改写保留原始请求的底层目标,但去除上下文包装;然后由多个独立的 LLM 安全评分器对原始提示和改写版本在连续风险尺度上打分;最后决策模块结合绝对风险阈值和原始/改写之间的相对风险变化,自适应地选择拦截、放行或警告。实验基于 Llama-3-8B-Uncensored 和 DeepSeek-V4-Flash 两个模型,针对 UNIATTACK、CIPHER、DeepInception 三类攻击并采用 AdvBench 和 OR-Bench-Hard 基准进行评估。结果显示 SRD-GUARD 的平均有害检测成功率(DSR)分别为 91.44% 和 100%,而合法请求过拒率(ORR)分别为 8.00% 和 12.00%,相比基线取得了更优的 DSR-ORR 权衡。消融实验证明:重写能够暴露隐藏的有害意图;联合评分可增强对单个评分器行为的稳健性;风险自适应决策支持对模糊输入的差异性处理。这些结果表明,语义意图暴露、共识风险评估与相对风险感知路由为黑盒越狱防御提供了一种有效且可选择性强的思路。论文仅提供了 abstract,未包含详细方法推导与完整实验细节,无法验证其实现复现性,因此相关结论需谨慎看待。适合 LLM 安全研究者、红蓝队人员及模型部署方阅读。

💡 推荐理由: 论文针对 LLM 部署中的越狱攻击,提出无需微调、黑盒可用的推理时防御,核心是语义重写暴露意图与多模型共识评分,能改善误拒率,对安全运营和模型护栏设计有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
推荐 5.5
Conf: 50%
👥 作者: Jakub Reš, Petr Kaška, Martin Perešíni, Martin Ukrop, Kamil Malinka

该论文针对大型语言模型(LLM)面临的越狱攻击问题,提出了一种名为 AlcaTRAz(Anchored Tree-Rule defense Against jailbreaks)的提示词级别防御方法。越狱攻击通过精心构造的输入绕过模型的安全对齐,而现有防御大多依赖访问模型权重或内部状态,难以应用于黑盒部署场景。AlcaTRAz 仅操作输入文本,无需修改或重训练目标模型,因此可适配黑盒 API 服务。其核心思想是自动学习一种可迁移的变换规则,在选定位置插入受控的字符级扰动,从而破坏越狱攻击所依赖的结构规律,同时在良性查询上尽量保持模型的原始功能。作者在 33 个开源权重模型、22 种越狱攻击类型以及一个短单轮良性问题基准上进行了评估,并与三种代表性的提示词级别基线防御(Llama Guard、RA-LLM、Goal Prioritization)进行对比。结果显示,AlcaTRAz 在 73.4% 的模型-攻击组合中取得了最佳的综合安全性与功能性得分;在未防御情况下,聚合分数众数为 10(对恶意请求给出最大严重性响应),而采用 AlcaTRAz 后下降到 2(接近拒绝回答)。同时,良性查询的平均得分仅从 8.62 降至 8.35(0-10 量表),差距在 0.27 分以内。尽管 AlcaTRAz 显著降低了越狱成功率,但并未完全消除,仍存在高严重性残留,且未考虑自适应攻击者。因此论文将 AlcaTRAz 定位为深度防御体系中的一个环节,而非独立保证。该工作适合 LLM 安全研究者、红蓝队人员以及需要部署轻量级输入防御的工程团队阅读。

💡 推荐理由: 对蓝队而言,提供了一种无需访问模型内部、仅靠输入变换就能缓解越狱的轻量方案,适合黑盒 LLM 服务;同时强调防御并非一劳永逸,需结合深度防御策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tongyan Hu, Bryan Hooi

本文针对大型语言模型(LLM)面临的越狱攻击防御问题提出了一种自进化的多智能体框架。当前LLM虽经过安全对齐,但仍易被角色扮演、混淆、代码转换、多步间接等越狱技术诱导产生有害输出。现有防御多为静态部署,无法根据新出现的攻击积累经验或自适应调整。为此,作者提出了一种基于持久跨交互规则记忆的测试时防御机制:当检测到一次攻击成功时,框架将该失败案例抽象为方法级别的规则,即捕获攻击的结构性封装方式而非其具体有害主题,并在未来输入中复用该规则。由于规则基于方法层面,一条规则可泛化至整个攻击家族,且随着新型封装器的出现,标签空间可自动扩展。该机制完全通过外部记忆与提示工程实现,无需更新模型参数,适用于开源权重模型及黑盒API模型。框架由四个协作模块组成,但核心贡献在于记忆驱动的自适应机制而非模块划分本身。作者在四个黑盒越狱家族及多种模型上进行了实验,结果表明该方法能显著降低攻击成功率,同时保持良性任务的实用性,在自适应复合封装器攻击下依然稳健,且随着记忆增长不会导致过度拒绝增加。这项工作为LLM防御提供了新的动态自适应思路。

💡 推荐理由: 越狱攻击是LLM安全的核心威胁,静态防御难以应对不断演变的攻击。该研究提出记忆驱动的自进化防御,使防御系统能从成功攻击中学习并泛化到未知变体,对提升LLM在现实场景中的鲁棒性有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Aaditya Pratap, Harsh Kasyap, Somanath Tripathy

本文对本地部署大语言模型(LLM)的输入侧越狱防御机制进行了系统性审计。研究背景是:通过Ollama等推理引擎本地部署的LLM,缺乏API服务模型所具备的内容审核与滥用检测机制,因此模型安全性完全依赖于防御手段,而防御手段的有效性取决于其设计时基于的假设。论文针对越狱攻击下的防御机制展开审计,将防御分为两类:一类提供形式化保证(如SmoothLLM、Erase-and-Check、Sequential Monitors),另一类依赖经验检测结果(如Semantic Smoothing、Self-Denoised Smoothing、Perplexity Filtering)。作者并不停留在观察防御失效,而是将每次失败追溯至具体假设:对每种防御提取其依赖的条件,推导出假设被违反时应当出现的经验模式,并在六个开放权重模型(14B至35B参数)上,使用包含100个越狱提示(来自40多个公开来源)的语料库进行测试,总计生成13,800条评估记录。核心贡献在于提供了防御失效根因分析框架,揭示了防御假设与语义攻击实际行为之间的差距,为设计和评估针对语义越狱的鲁棒防御提供实证依据。适合安全研究员、红队成员以及负责本地LLM部署与安全治理的工程师阅读。

💡 推荐理由: 本地部署LLM缺乏云端过滤,安全完全依赖防御机制。本文首次将防御失效追溯到具体假设,帮助蓝队理解为何现有防御会被语义攻击绕过,为评估和选择防御提供实证依据。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

本文针对多模态大语言模型(MLLM)在视觉输入场景下的新型安全风险展开研究。作者指出,在许多多模态越狱攻击中,单独的文本提示或图像本身并无危害,但当模型将一个看似无害的操作(如摘要、翻译、指令跟随)绑定到一个具体视觉目标时,不安全行为便会产生。这种“引用依赖”的失败模式暴露了现有防御机制的结构性弱点:当前防御大多将提示-图像对作为一个整体进行审核,而真正需要关注的安全单元是模型在解引用(dereference)过程中形成的“操作-目标”对。基于此,作者提出了一种名为COMIC的引用感知预生成安全门控机制。COMIC首先推断请求的操作和引用类型,通过OCR和开放词汇目标建议构建候选目标,完成对可行指称对象的定位,然后对显式的“操作-目标”对进行安全性评估。为保守处理歧义,COMIC在决定放行或阻止请求之前,结合了最大风险聚合和质量感知路由。作者在多个开源MLLM、局部化及更广泛的多模态越狱基准测试以及良性引用敏感场景中评估了COMIC,结果表明该方法在保持良性效用和实际效率的同时,持续增强了模型的鲁棒性。该研究进一步表明,若不对请求操作、该操作所作用的视觉目标以及该指称定位的置信度进行建模,多模态安全将无法可靠地得到保障。

💡 推荐理由: 该研究揭示了多模态大模型安全防御的关键盲区:现有方法忽略“操作-目标”级引用关系,导致恶意语义可被分割到独立的提示与图像中而绕过审核。COMIC为构建引用感知的安全门控提供了新思路,对防范新兴多模态越狱攻击具有重要实践价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hongli Shen, Shaopeng Fu, Qinbo Zhang, Jian Li, Di Wang

本论文针对大型推理模型(LRMs)在复杂任务上表现优异但易受有害提示诱导而输出不安全内容的问题,提出了一种名为 AdvSafe 的双对抗安全对齐框架。现有对齐方法通常依赖直接拒绝或安全推理,但往往局限于提示模式而非内在攻击机制,导致难以泛化到多样化的越狱攻击,鲁棒性和推理效用难以兼顾。AdvSafe 的核心思路是让模型通过显式解构对抗机制来内化不安全知识,从而超越模式依赖,建立稳健的认知防御而不损失推理能力。该框架采用两阶段对抗博弈:首先在对抗合成阶段,一个自主智能体动态构造欺骗性越狱提示,并调整策略以突破强教师模型;其次在对抗提取阶段,被突破的教师模型执行认知反攻击,针对每次成功的越狱,解释攻击成功的原因以及如何识别和缓解此类提示。这一过程生成一个紧凑的推理数据集,包含丰富且可泛化的不安全知识。基于该数据集训练的学生模型,能够通过内在威胁理解隐式获得安全对齐。实验表明,仅使用 1K 合成样本,AdvSafe 对齐的 LRM 相比现有基线显著增强了越狱鲁棒性,且几乎没有效用损失。此外,AdvSafe 还提升了对分布外提示的鲁棒性,证明了学习不安全知识能够实现更优的鲁棒性-效用权衡,并泛化到未见过的攻击模式。该研究适合关注 LLM/LRM 安全对齐、对抗鲁棒性和红队防御的研究人员与安全工程师阅读。

💡 推荐理由: 提供一种不牺牲推理效用的新安全对齐思路,从机制层面提升越狱鲁棒性,对 LLM 安全防御有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiyong Liu, Yixin Wu, Jun Sakuma

本文针对大型推理模型(LRM)暴露出的新型安全失效模式展开研究:对抗性提示能够操纵推理上下文、任务分解或能力解释,使有害目标被当作合法推理步骤处理。现有防护手段(如安全提醒、外部分类器、自检查包装器)往往脆弱,原因在于它们要么直接检查对抗性提示,要么让目标模型在与攻击利用的同一表面上执行额外的安全推理。为此,作者提出了一种与模型无关的推理时防护栏——能力路由防护(CRG),适用于防御者无法检查隐藏推理轨迹或修改模型权重的闭源LRM场景。CRG将提示防御重新定义为能力路由问题:一个侧信道控制器首先构建用户授权任务、活动上下文、安全证据和能力迁移风险的可信表示,将可执行意图与不可信的推理上下文分离。该表示支持路由特定执行,使CRG能够阻止高风险请求、约束模糊请求,并通过可信活动上下文转发低风险请求。最后,CRG应用TraceCheck验证与授权任务的一致性,并调用受限回退以保留低风险良性请求的实用性。大量实验表明,CRG有效缓解了多种以推理为中心的越狱攻击,同时保持良性实用并避免过度拒绝。进一步分析显示,其各组件贡献互补,凸显了协调防御机制对于保护大型推理模型的重要性。

💡 推荐理由: 为闭源推理模型提供了一种不依赖内部信息的新型防护思路,填补了针对推理中心越狱的防御空白,对依赖第三方大模型API的安全团队具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zhongyang Lin, Ziran Zhao, Feifei Zhai, Pengyuan Liu

这篇论文提出了 NeuroArmor,一种针对大型语言模型(LLM)的越狱攻击白盒运行时防御方法。现有防御通常对所有提示采用相同策略,导致在安全性和有用性之间难以平衡,容易误伤良性敏感请求。NeuroArmor 针对每个输入提示生成多个安全变体(如无害化改写),作为局部安全参考。在隐藏状态空间中,将原始提示状态与这些安全变体进行比较,通过一致性检查判断提示是否异常。若异常,则路由到拒绝分支或恢复分支:对恶意提示直接拒绝,对边界良性提示进行修复后输出。在 Llama-3-8B-Instruct 上的实验表明,NeuroArmor 将恶意攻击成功率从 41.56% 降至 1.57%,同时良性误报率从 30.26% 降至 22.05%,优于多个基线。外部评估显示未被拦截的响应也极少产生操作性危害。该方法的核心贡献在于提示专用的一致性检查与选择性干预机制,有效兼顾安全与可用性。

💡 推荐理由: 当前越狱攻击手段多样且隐蔽,现有防御常因过站误拦或漏检而失效。NeuroArmor 通过细粒度、提示特异的局部参考实现安全与有用性的更好平衡,对提升 LLM 的实际部署安全性具有直接借鉴意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Luoyu Chen, Weiqi Wang, Zhiyi Tian, Chenhan Zhang, Feng Wu, Jianhuan Huang, Ahmed Asiri, Shui Yu

该论文针对大型语言模型(LLM)面对越狱提示(jailbreak prompts)时的安全对齐问题展开研究。现有安全引导(safety steering)方法在测试时通过激活干预将越狱激活引导至拒绝区域,同时保持良性功能,但这些方法本质上是监督式的,且依赖于静态的有限训练集。当出现训练集中未见过的新型越狱攻击时,由于激活分布偏移(out-of-distribution),这些方法往往失效。为解决对未见越狱攻击的防御失败问题,论文提出了一种基于无监督潜在方向发现的双层对抗训练框架(Bi-level Adversarial Training),用于零样本越狱防御。在内部步骤中,通过无监督潜在方向发现,从拒绝态有害请求激活(refusal-state harmful-request activations)中外推(extrapolate)模拟多种多样的越狱激活,从而扩展对真实越狱激活子空间的覆盖范围。在外部步骤中,训练一个势诱导引导场(potential-induced steering field),将这些对抗性越狱状态推回拒绝区域,同时保持良性请求的激活不变。在三个不同规模的LLM和六个经典越狱攻击家族上评估,该方法在大多数情况下将攻击成功率(ASR)降至5%以下。训练过程中子空间覆盖率的不断提升解释了泛化能力增强的原因。该工作为LLM安全对齐提供了新的防御思路,尤其适用于应对动态演化的未知越狱攻击。

💡 推荐理由: 当前LLM安全防御多针对已知攻击,面对未知变种效果不佳。本文提出的无监督模拟加对抗训练方法能零样本泛化,显著提升对未见越狱攻击的鲁棒性,为实际部署LLM提供更可靠的安全保障。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Kemal Derya, Berk Sunar

本文针对大型语言模型(LLM)的越狱攻击防御展开研究,重点重访了近期提出的JBShield防御机制。JBShield通过检测两种概念信号(毒性概念和越狱概念)来识别恶意提示,在部分设置下声称攻击成功率为0%。然而,本文设计了一种新的自适应攻击方法JB-GCG,它修改了贪婪坐标梯度(GCG)攻击的目标函数,结合了两个项:一是通过计算拒绝方向与隐藏状态表示的余弦相似度来抑制拒绝方向,二是利用JBShield自身的毒性概念分数进行正则化。在Llama-3-8B模型上的五种配置中,JB-GCG实现了平均46.2%的攻击成功率,最强设置下达到53.4%。攻击对JBShield的增强版本JBShield-M同样有效,成功率高达30.7%。实验表明,该攻击在多次重新校准后依然有效,确认了漏洞是结构性的而非校准特定。进一步分析发现,越狱表示的余弦相似度特征在拒绝方向指纹空间中占据了一个独特区域,既不属于无害提示也不属于有害提示。基于此,作者提出了表示轨迹验证(RTV)新防御方法,利用多层拒绝方向指纹进行马氏距离异常检测,对提出的攻击实现了0.99的AUROC。最后,作者设计了针对RTV的完全白盒自适应攻击,最佳攻击在计算成本增加13倍的情况下仅达到7%的成功率。结果表明,非自适应检测的强性能并不意味着在自适应威胁模型下具有鲁棒性,多层表示一致性比单层概念相似性更适合作为越狱检测的基础。

💡 推荐理由: 该研究揭示了现有越狱防御在自适应攻击下的脆弱性,强调了评估防御时必须考虑自适应威胁模型,为LLM安全社区提供了更可靠的防御设计方向。

🎯 建议动作: 建议安全研究人员阅读原文,了解自适应攻击细节,并评估自身LLM防御系统对类似攻击的鲁棒性。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

该论文针对大语言模型(LLM)面临的分解式越狱攻击提出了一种新型防御框架。分解式越狱攻击通过将恶意目标拆分为一系列看似无害的查询,使攻击者能够绕过安全防护,累积重构出被禁止的内容。在实际部署中,LLM面对连续、不可追溯的匿名请求流,其中混杂着隐蔽分布的对抗性查询,现有防御策略在无可靠用户元数据时无法跟踪全局历史上下文,且基于生成模型的实时监控计算开销过大。为此,作者提出TwinGate,一种状态ful双编码器防御框架。TwinGate采用非对称对比学习(ACL),将语义不同但意图匹配的恶意片段在共享潜在空间中聚类,同时利用并行的冻结编码器抑制良性主题重叠导致的误报。每个请求仅需一次轻量级前向传播,可在目标模型填充阶段并行执行,延迟开销可忽略。为评估方法并推动未来研究,作者构建了包含超过362万条指令、覆盖8600种恶意意图的综合数据集。在严格因果协议下的大规模语料评估中,TwinGate实现了高恶意意图召回率和极低的误报率,且对自适应攻击具有强鲁棒性。相较于有状态和无状态基线,该方法在吞吐量和延迟方面均显著优于同类方案。该研究适合LLM安全研究人员、AI红队成员以及致力于构建实用防御机制的工程师阅读。

💡 推荐理由: 分解式越狱攻击是当前LLM安全中的隐蔽威胁,TwinGate提出了一种高效的状态ful防御方案,在不依赖用户身份的前提下实现高精度检测,对实际部署场景具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)