#preference-optimization

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Sizhe Chen, Arman Zharmagambetov, Saeed Mahloujifar, Kamalika Chaudhuri, David A. Wagner 0001, Chuan Guo 0001

本文提出一种基于偏好优化的防御方法 SecAlign,用于缓解大型语言模型(LLM)面临的提示注入攻击。在 LLM 与外部数据源(如用户文档、网络检索结果、API 返回等)交互时,攻击者可将恶意提示注入这些外部内容,覆盖系统原有指令并执行恶意操作。SecAlign 的核心思路是构建一个偏好数据集,其中每个样本包含一个经过提示注入的输入、一个安全输出(响应合法指令)和一个不安全输出(响应注入指令)。然后利用偏好优化算法(如直接偏好优化 DPO)训练 LLM,使其更倾向于生成安全输出而非不安全输出。实验表明,SecAlign 能将多种提示注入攻击的成功率降至 10% 以下,即使面对训练中未见过的更复杂攻击也能保持有效,说明具有良好的泛化能力。同时,经过防御训练的模型在实用性上与原始模型相当,没有显著降低语言生成质量。该工作提供了首个已知的基于偏好优化的提示注入防御方法,代码已开源。

💡 推荐理由: 提示注入是 LLM 应用中的关键安全威胁,现有防御效果有限。SecAlign 提供了一种系统化的偏好优化框架,可显著降低攻击成功率且泛化性强,为构建更安全的 LLM 代理系统提供了实用方案。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)