#distribution-shift

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Thiago Sandoval, Ufuk Topcu

本文针对大型语言模型(LLM)部署中安全分类器(safety classifier)失效的两大痛点提出解决方案:一是分类器在训练时学到的策略与部署方(deployer)期望的策略不一致,导致决策偏差;二是随着部署流量分布演化,分类器性能会逐渐退化。作者提出了一种轻量级包装方法——Regime-Conditional Verification (RCV),无需重新训练基础分类器即可使其适应部署方策略。RCV 从分类器的内部表示中估计每次预测与部署方策略不一致的概率,并选择性地修正可能出错的预测。这些正确性估计同时可作为无标签信号用于检测分布偏移,从而触发维护循环:优先更新正确性估计层,仅在必要时才对分类器进行微调。实验基于三种现成安全分类器和两个基准数据集,RCV 在所有分类器-数据集组合上均提升了对部署方策略的符合度,最多能捕获此前漏掉的 0.81 的不安全内容,且不修改底层分类器。在包含十个攻击场景的部署研究中,每个场景对应一个在 RCV 训练中未见的危害类别,RCV 在专用注入面板中检测到了每个攻击场景;在维护普查中,大多数漂移事件通过更新估计层即可修复,无需更新分类器,只有残余事件才需要微调。本文的核心贡献在于:提出一种无需重训练的模型适配与监控机制,将安全分类器的策略对齐和分布漂移监测统一在同一个概率框架下,为 LLM 安全运维提供了轻量级、可解释的解决方案。

💡 推荐理由: LLM 安全分类器在实际部署中常因策略错配和分布漂移而失效,RCV 提供了一种无需重训的轻量适应机制,能让蓝队在不改动基础模型的前提下提升安全过滤效果,并自动感知攻击或数据漂移,对 SOC 的模型安全运维有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Runhan Song, Qiqi Liu, Chuanzhou Pan, Zhenquan Ding, Youquan Xian, Chongru Fan, Lei Cui, Wei Wang, Zhiyu Hao

本文提出 CipherSight,一种基于 TLS 记录层的高鲁棒性 HTTPS 网站指纹识别(WF)框架,旨在解决真实部署中因时间和地域变化导致的分布偏移(OOD)以及开放世界场景中不断出现的新网站问题。现有方法主要从原始 TCP 包序列中学习特征,容易受传输层噪声影响,难以捕获稳定且可泛化的网站表示。CipherSight 从 TLS 记录中联合编码多个记录级属性,并采用分层架构同时建模流内 TLS 记录依赖关系和跨并发流的交互,从而利用 HTTPS 流量的结构模式。为了学到鲁棒表示,CipherSight 引入掩码记录建模(MRM)任务来捕获上下文流量语义,并利用细粒度的记录-资源标注作为特权监督,通过结构感知目标和语义蒸馏进行训练。实验表明,在超过 2000 个网站类别的封闭世界设定下,CipherSight 达到 95.41% 的准确率;在时间和地理漂移下仍保持超过 90% 的准确率,持续优于所有对比基线。该研究主要面向流量分析、隐私保护和深度学习应用于网络安全的研究人员。

💡 推荐理由: 网站指纹识别是评估加密流量隐私泄露风险的关键技术。CipherSight 通过 TSL 记录级表征和分层建模,显著提升了在真实网络环境变化和开放世界场景下的鲁棒性,对设计更稳定的流量识别系统有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jun Wen Leong

该论文提出了一种针对已部署安全分类器的在线分布漂移监测系统。系统利用校准的序贯统计量(如加权共形预测或逻辑密度比估计)实时检测分类器的输入分布是否发生变化。一旦检测到漂移,系统会通过共形弃权层自动调整决策阈值,以恢复预设的目标错误率(ε=0.1)。作者通过预注册的析因实验评估了系统性能,覆盖4种分类器、5种漂移条件、20个随机种子和2种窗口大小(共计800个实验单元)。结果显示,系统实现了86.6%(693/800,95%置信区间[84.1%,88.8%])的有效检测率,平均检测延迟为39.5步。检测能力在三种真实漂移场景中得到验证:合成数据引入的偏移(86.6%)、真实世界的时间越狱攻击(85%,17/20)以及GCG对抗攻击。在修正阶段,加权共形预测在DeBERTa分类器上恢复了最多39个百分点的覆盖率损失(有效样本量ESS=46/300),但在其他分类器上完全失效(ESS接近300)。逻辑密度比估计在高维嵌入空间中实现了完美的源/目标分离,导致所有重要性权重被截断至下限。DeBERTa展现出了从有效修正(释义变形,ESS=46)到几乎完全失效(对抗后缀,ESS=206)的梯度变化。将特征空间PCA降维至32维后,崩溃问题得到缓解,为Llama Guard恢复了33个百分点,为ShieldGemma恢复了21个百分点覆盖率。方差分解显示,分类器(η²=0.243)、漂移类型(η²=0.237)及其交互项(η²=0.185)对检测延迟的变异均有显著贡献(所有p<0.001),表明需要对每个分类器建立单独的监测配置。

💡 推荐理由: 安全分类器在生产环境中面临分布漂移导致性能退化的问题,该工作提供了首个标准化在线监测与自适应修复框架,对LLM安全防护的持续有效性保障具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)