#adaptive-defense

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Thiago Sandoval, Ufuk Topcu

本文针对大型语言模型(LLM)部署中安全分类器(safety classifier)失效的两大痛点提出解决方案:一是分类器在训练时学到的策略与部署方(deployer)期望的策略不一致,导致决策偏差;二是随着部署流量分布演化,分类器性能会逐渐退化。作者提出了一种轻量级包装方法——Regime-Conditional Verification (RCV),无需重新训练基础分类器即可使其适应部署方策略。RCV 从分类器的内部表示中估计每次预测与部署方策略不一致的概率,并选择性地修正可能出错的预测。这些正确性估计同时可作为无标签信号用于检测分布偏移,从而触发维护循环:优先更新正确性估计层,仅在必要时才对分类器进行微调。实验基于三种现成安全分类器和两个基准数据集,RCV 在所有分类器-数据集组合上均提升了对部署方策略的符合度,最多能捕获此前漏掉的 0.81 的不安全内容,且不修改底层分类器。在包含十个攻击场景的部署研究中,每个场景对应一个在 RCV 训练中未见的危害类别,RCV 在专用注入面板中检测到了每个攻击场景;在维护普查中,大多数漂移事件通过更新估计层即可修复,无需更新分类器,只有残余事件才需要微调。本文的核心贡献在于:提出一种无需重训练的模型适配与监控机制,将安全分类器的策略对齐和分布漂移监测统一在同一个概率框架下,为 LLM 安全运维提供了轻量级、可解释的解决方案。

💡 推荐理由: LLM 安全分类器在实际部署中常因策略错配和分布漂移而失效,RCV 提供了一种无需重训的轻量适应机制,能让蓝队在不改动基础模型的前提下提升安全过滤效果,并自动感知攻击或数据漂移,对 SOC 的模型安全运维有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)