本文针对大型语言模型(LLM)在面对不断演进的提示注入攻击时现有防御机制不足的问题,提出了一种持续偏好优化框架COPA。提示注入攻击通过将恶意指令嵌入用户输入或外部内容,可操控模型行为并绕过安全限制。现有防御大多采用静态策略,如固定的对齐目标或针对特定攻击的过滤机制,一旦出现新的攻击形式就需要重新设计,无法适应自适应对手的持续进化。虽然近期的终身对齐方法能够处理用户偏好的变化,但并未考虑攻击者会利用之前防御的弱点不断演化。COPA将提示注入防御视为一个终身学习问题,采用基于GRPO(组相对策略优化)的增量优化方式,持续吸收新观察到的攻击反馈,并通过边际加权经验回放机制保留对旧攻击类型防御能力,从而在适应新威胁的同时缓解灾难性遗忘,保持模型的通用能力。实验在可持续的提示注入攻击流上进行,结果表明COPA能显著降低攻击成功率,与现有最先进防御相比最多降低6.3倍,平均降低4.4倍,验证了持续偏好优化作为对抗自适应攻击者防御范式的有效性。该研究为LLM在实际部署中面临的安全威胁提供了一种动态防御新思路,适合模型安全研究者和安全运维工程师阅读。
💡 推荐理由: LLM应用正面临不断演变的提示注入攻击,传统静态防御难以应对。COPA提出持续学习框架,可随新攻击自适应更新,为蓝队提供了一种从终身学习视角构建动态防御的参考。
🎯 建议动作: 研究跟进