#prompt-robustness

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen

本文针对大型语言模型(LLM)在微调过程中存在的安全漏洞展开研究。作者指出,恶意数据提供者可以将有害行为嵌入下游训练语料,导致模型在保留专业技能的同时,按照要求违背人类价值观。现有的安全重对齐防御通常面临三大局限:一是容易造成模型对专业技能的灾难性遗忘;二是在防御者无法观测到攻击者使用的提示模板时,防御效果显著下降;三是成功重对齐的模型仍可能通过简单的系统提示切换被再次越狱。为应对这些问题,论文提出了一种名为路由式基于策略的蒸馏(Routing-based On-Policy Distillation, ROPD)的新型重对齐框架。ROPD的核心思想是直接建模对齐模型与受攻击模型输出概率分布之间的差异,而不是拟合特定的提示模板,从而提升对模板变化的鲁棒性。作者在三个数据集和三个具有不同对齐强度的基础模型上,将ROPD与四种最先进的基线方法进行了广泛对比实验。结果表明,当基线防御面临模板不匹配时,其下游任务性能往往出现严重退化;相比之下,ROPD能够显著缓解模板不匹配风险,在防御有效性和能力保留方面均保持更强的鲁棒性。尽管分析显示ROPD并非完全免疫于模板偏移,但其性能下降幅度相比现有方法可以忽略不计,为稳健的LLM重对齐建立了新的标准。该研究适合LLM安全研究人员、模型对齐工程师以及关注供应链安全的防御者阅读。

💡 推荐理由: 该研究直击LLM微调供应链中的安全风险,提出的ROPD方法在防御模板变化方面显著优于现有基线,为蓝队提供了一种更抗绕过、更少遗忘的重对齐思路,有助于提升AI系统在实际对抗环境中的稳健性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)