#alignment

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen

本文针对大型语言模型(LLM)在微调过程中存在的安全漏洞展开研究。作者指出,恶意数据提供者可以将有害行为嵌入下游训练语料,导致模型在保留专业技能的同时,按照要求违背人类价值观。现有的安全重对齐防御通常面临三大局限:一是容易造成模型对专业技能的灾难性遗忘;二是在防御者无法观测到攻击者使用的提示模板时,防御效果显著下降;三是成功重对齐的模型仍可能通过简单的系统提示切换被再次越狱。为应对这些问题,论文提出了一种名为路由式基于策略的蒸馏(Routing-based On-Policy Distillation, ROPD)的新型重对齐框架。ROPD的核心思想是直接建模对齐模型与受攻击模型输出概率分布之间的差异,而不是拟合特定的提示模板,从而提升对模板变化的鲁棒性。作者在三个数据集和三个具有不同对齐强度的基础模型上,将ROPD与四种最先进的基线方法进行了广泛对比实验。结果表明,当基线防御面临模板不匹配时,其下游任务性能往往出现严重退化;相比之下,ROPD能够显著缓解模板不匹配风险,在防御有效性和能力保留方面均保持更强的鲁棒性。尽管分析显示ROPD并非完全免疫于模板偏移,但其性能下降幅度相比现有方法可以忽略不计,为稳健的LLM重对齐建立了新的标准。该研究适合LLM安全研究人员、模型对齐工程师以及关注供应链安全的防御者阅读。

💡 推荐理由: 该研究直击LLM微调供应链中的安全风险,提出的ROPD方法在防御模板变化方面显著优于现有基线,为蓝队提供了一种更抗绕过、更少遗忘的重对齐思路,有助于提升AI系统在实际对抗环境中的稳健性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alex Kwon

该论文对一种名为“Prefill Jailbreak”的越狱攻击进行了深入的机制研究。在这种攻击中,攻击者只需在提示开头添加一行预填充文本(例如“Sure, here is”),就能使经过安全对齐的大语言模型放弃拒绝回答有害请求的行为。论文首先通过线性探针实验发现,即使在模型被成功越狱的情况下,模型内部对“有害性”的表示(harm representation)依然保持完整:在那些本应被拒绝但实际却输出有害内容的提示上,线性探针从模型内部表示读取到的有害性分数依然很高(0.91-0.98),与拒绝状态下相当。这说明拒绝机制并非由模型深层对有害性的感知决定,而是一个发生在响应生成阶段的浅层计算。然后,通过剂量匹配的位置控制实验,论文将拒绝机制的失效定位到响应生成的前半部分:扰动早期一半的响应生成就是以破坏拒绝行为,而对后半部分的干预几乎无效。进一步,论文采用了三种因果探针方法(包括注意力掩码、表示方向干预和注意力抑制)确认了这一关键窗口。具体地,通过恢复早期响应中“有害性”方向的部分表示,可以部分重新激活拒绝行为;而注入模型在拒绝状态下的内部表示,则能逆转越狱效果(在留出测试集上达到74%的成功率)。此外,通过敲除早期响应部分对预填充token的注意力,而非其他等量注意力的位置,可以特异性破坏有害内容的继续生成。作为对比,在未经安全微调的基础模型上进行同样实验,发现同样的敲除操作同样会特异性破坏预填充后的有害内容生成(有害内容从64%降至25%,而对照组的64%保持不变)。这表明预填充token的强制作用本质上是通用的自回归条件概率(即模型倾向于延续输入前缀的分布),而非安全特定的抑制解除。因此,论文认为“拒绝恢复”是一种依赖于模型的回退机制,而主导的越狱机制是被动的(即模型自然地顺应预填充)。论文还发现存在一个微小的安全特定吸引子(logit-trace集中度0.24 vs 0.03),但未能完全分离其主动与被动成分。最终结论是:拒绝决策在表示空间中是可解码但分布式存储的,不存在一个单一的“拒绝神经元”或方向;拒绝机制跟踪的是有害性而非表面的“危险”词汇。这一研究的实际含义是:如果监控系统只读取提示端的表示,那么它天然就会对这类响应级攻击免疫,但这也意味着检测手段必须关注响应生成过程;整个机制是弥散的,但攻击的失败界面是局部的(集中在响应早期)。本文适合大模型安全研究人员、AI对齐技术开发者以及红蓝队成员阅读。

💡 推荐理由: 该研究揭示了对齐大语言模型拒绝机制的本质弱点:拒绝是响应阶段的浅层计算,攻击者只需操控模型生成的初始部分即可绕过。这种机理洞察对于设计更鲁棒的安全检测和防御策略至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.5
Conf: 50%
👥 作者: Pengrun Huang, Chhavi Yadav, Ruihan Wu, Kamalika Chaudhuri

本文研究了大型语言模型(LLM)在领域特定数据集上微调时面临的数据集属性泄露风险。近期研究表明,通过属性推断攻击(property inference attacks),攻击者能够有效提取模型训练数据集中的敏感属性(如数据集的整体分布特征),从而构成保密性威胁。现有防御方法主要依赖于修改训练数据分布,这需要访问原始数据并重新训练模型,限制了其在数据不可用或模型已部署场景下的适用性。本文提出基于对齐(alignment)的防御方法,通过后训练对齐(post-training alignment)重塑模型输出分布,使其朝向目标属性比例,而无需修改训练数据或重新训练。具体地,作者将两种广泛使用的基于人类反馈的强化学习(RLHF)框架——直接偏好优化(DPO)和组相对策略优化(GRPO)——适配为防御方法:DPO通过构造偏好对(将属性比例正确的输出作为偏好样本),GRPO通过定义特定奖励函数来惩罚属性泄露。综合实验表明,基于对齐的防御能有效缓解属性推断攻击,同时在模型效用与隐私保护之间取得良好平衡。本文的主要贡献在于首次将对齐技术应用于防御属性推断攻击,提供了无需数据访问的轻量级解决方案,对保护微调数据的隐私具有重要实践意义。适合关注LLM隐私保护、对抗性攻击防御的研究人员和工程师阅读。

💡 推荐理由: 为LLM微调场景下的数据集属性泄露问题提供了一种无需重新训练、无需原始数据即可部署的防御方案,填补了现有防御在数据不可用时的空白。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)