#lifelong-learning

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Roshan Sood, Onat Gungor, Tajana Rosing

本文针对大型语言模型(LLM)在面对不断演进的提示注入攻击时现有防御机制不足的问题,提出了一种持续偏好优化框架COPA。提示注入攻击通过将恶意指令嵌入用户输入或外部内容,可操控模型行为并绕过安全限制。现有防御大多采用静态策略,如固定的对齐目标或针对特定攻击的过滤机制,一旦出现新的攻击形式就需要重新设计,无法适应自适应对手的持续进化。虽然近期的终身对齐方法能够处理用户偏好的变化,但并未考虑攻击者会利用之前防御的弱点不断演化。COPA将提示注入防御视为一个终身学习问题,采用基于GRPO(组相对策略优化)的增量优化方式,持续吸收新观察到的攻击反馈,并通过边际加权经验回放机制保留对旧攻击类型防御能力,从而在适应新威胁的同时缓解灾难性遗忘,保持模型的通用能力。实验在可持续的提示注入攻击流上进行,结果表明COPA能显著降低攻击成功率,与现有最先进防御相比最多降低6.3倍,平均降低4.4倍,验证了持续偏好优化作为对抗自适应攻击者防御范式的有效性。该研究为LLM在实际部署中面临的安全威胁提供了一种动态防御新思路,适合模型安全研究者和安全运维工程师阅读。

💡 推荐理由: LLM应用正面临不断演变的提示注入攻击,传统静态防御难以应对。COPA提出持续学习框架,可随新攻击自适应更新,为蓝队提供了一种从终身学习视角构建动态防御的参考。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, Tomas Pfister, Long T. Le

本文提出了 LiSA (Lifelong Safety Adaptation) 框架,旨在解决 AI Agent 部署后的安全护栏适应性问题。随着 AI Agent 从聊天界面扩展到读取私有数据、调用工具和执行多步骤工作流,护栏失效的后果不再是单纯的回答质量错误,可能引发秘密泄露、危险操作授权或阻碍合法工作。最棘手的失效往往是上下文相关的:一个行为是否可接受取决于当地的隐私规范、组织策略和用户期望,而这些很难在部署前完全指定。这造成了实际差距:护栏需要适应其运行环境,但部署反馈通常仅限于稀疏且带有噪声的用户报告,且重复微调往往不切实际。为此,LiSA 通过结构化记忆改进固定基础护栏。LiSA 将偶发失效转化为可复用的策略抽象,使稀疏报告能够泛化到个别案例之外;引入冲突感知的局部规则以防止混合标签上下文中的过度泛化;并通过后验下界应用证据感知的置信门控,使得记忆复用的规模随积累的证据而非单纯的经验准确性增长。在 PrivacyLens+、ConFaide+ 和 AgentHarm 三个基准上,LiSA 在稀疏反馈条件下一致优于强记忆基线,即使在 20% 的标签翻转率噪声下依然稳健,并将延迟-性能边界推至超过骨干模型缩放的效果。总之,LiSA 为确保 AI Agent 免受现实世界边缘风险的长尾问题提供了实用路径。

💡 推荐理由: AI Agent 的安全护栏必须动态适应运行环境,但部署后反馈稀疏且噪声大。LiSA 提供了一种无需频繁微调即可持续改进护栏的方法,解决了护栏在复杂真实场景下的泛化与鲁棒性难题。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)