#abliteration

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Aashiq Muhamed, Mona T. Diab, Virginia Smith

开放权重语言模型的安全护栏可被"拒绝特征消融"(Refusal Feature Ablation, RFA) 轻易绕过:该技术通过对比估计器在模型残差流中定位出一条线性"拒绝方向",并将其投影剔除,从而在几乎不损失模型通用能力的前提下获得很高的攻击成功率 (ASR)。针对这类攻击的传统防御通常需要对每一个新的模型检查点进行安全微调,计算成本高昂、难以规模化。本文提出"诱饵方向优化"(Decoy Direction Optimization, DDO),一种快速的事后权重编辑防御,无需对基座模型做任何微调。其核心机理洞察是:消融攻击依赖对比估计器来寻找拒绝方向,因此与其试图隐藏真实的拒绝回路,不如主动向网络 MLP 神经元中注入一个高幅值、非线性的诱饵信号。当攻击者尝试定位拒绝方向时,该诱饵会污染其估计器,诱导攻击者错误地消融一个无害的正交特征,而真实的安全机制仍保持完好。作者进一步给出了刻画这一效应的形式化谱界 (spectral bound) 证明。实验方面,DDO 在六个模型家族上进行了评估,在标准 RFA 攻击下 ASR 低于 10%;在 Llama-3-8B-Instruct 上,面对自适应多阶段攻击,DDO 与经过训练的防御基线表现相当(最坏情况 ASR 65% 对 58%),并将 Heretic 权重级攻击的 ASR 从 88.7% 降至 18%,而每配置的优化成本仅为训练式基线的 1/30 至 1/450。

💡 推荐理由: 开放权重模型一旦发布,任何人都能对权重做后处理,消融类攻击成本极低,而传统防御需逐检查点微调,难以规模化。DDO 提供了一种低成本事后加固路径,对模型发布方、模型托管平台与下游部署团队有直接工程价值,也提出"防御即扰动攻击者估计器"这一新范式。

🎯 建议动作: 研究跟进,并纳入内部模型发布安全评估流程试点

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Cristina Carleo, Pietro Liguori, Naghmeh Ivaki, Domenico Cotroneo

本文研究了一种名为“abliteration”的低秩权重编辑方法,用于解除代码大语言模型(LLM)在生成指定漏洞代码时的安全对齐拒绝行为。在基于学习的安全漏洞检测任务中,大规模有标注漏洞代码数据集的构建一直面临标签噪声问题,现有的LLM增强方法往往只是变换已有的漏洞种子,而非根据规范合成漏洞,导致标注不准确。因此,作者提出从安全代码出发,利用指令调优的LLM注入特定CWE(如CWE-89 SQL注入),但安全对齐的代码LLM通常会拒绝此类请求。Abliteration方法通过对模型残差流中的拒绝方向进行正交投影,实现在不显著影响代码生成能力的前提下消除拒绝行为。实验以Python和CWE-89为案例,评估了Qwen2.5-Coder-Instruct系列(3B、7B、14B参数)在PromSec和SafeCoder两个安全代码数据集上的表现,每种条件重复三次。结果显示:(i)拒绝行为与模型大小和提示上下文高度相关:14B模型拒绝100%的注入提示,7B在PromSec上拒绝73%但在SafeCoder上仅拒绝5%,而3B几乎从不拒绝;(ii)Abliteration将拒绝率降至零或接近零,同时保持语法有效性超过93%,表明在该设置下拒绝可以与代码生成能力分离;(iii)注入后的漏洞注入率受限于模型能力:14B达到88-97%,7B达到89-90%,3B仅25-48%,从而区分了“意愿”(通过abliteration实现)与“能力”(随参数规模增长)。漏洞判定通过CodeQL、Semgrep、Bandit三个工具的集成检测器以及两位作者对检测器阳性结果的人工裁决完成。本研究属于初步可行性探索,作者认为abliteration有望为漏洞数据集的规模化构建提供新途径,但同时也警示了潜在的安全风险。

💡 推荐理由: 该方法可能为安全社区提供一种高效生成带标签漏洞代码的途径,从而提升基于学习的漏洞检测器的训练数据质量;但同时可能被恶意利用来生成攻击样本,需要关注其双面性。

🎯 建议动作: 研究跟进:评估该方法在更多CWE类型和编程语言上的有效性,并探索检测或防御此类注入生成的策略。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)