#data filtering

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Zefeng Wu, Weiwei Qi, Jielong Chen, Tianhang Zheng, Di Hong, Chaochao Lu, Liang He, Zhan Qin, Kui Ren

该论文针对大型语言模型(LLM)微调过程中可能出现的安全性退化问题,提出了一种名为 DataShield 的数据风险评估框架。现有研究表明,即使使用良性任务特定数据进行微调,也可能显著削弱 LLM 的安全能力(如拒绝有害请求)。已有的风险识别方法通常依赖于单个模型及其 tokenizer 上的平均向量来表示安全方向,这限制了评估的有效性和可迁移性。DataShield 通过共识子空间对齐方法,从多个安全对齐的 LLM 中提取联合安全关键语义空间,并在这些空间内利用语义谱分解提取共识安全和不安全子空间。每个数据样本或响应段的风险通过计算其与不安全子空间和安全子空间的相对对齐程度来估计,从而实现样本级过滤和细粒度的段级掩码。实验结果表明,与最先进的过滤和掩码基线相比,DataShield 在样本过滤上平均将攻击成功率(ASR)降低了 14.6%,在段掩码上降低了 32.3%,同时保持了下游任务的效用,并避免了对目标模型的特定风险计算。这项工作为 LLM 微调阶段的数据安全性评估提供了新的途径,适合安全研究者、LLM 开发者和微调实践者关注。

💡 推荐理由: 该研究揭示了微调数据对LLM安全性的潜在风险,并提出一种不依赖单一模型的可迁移评估框架,有助于开发者在微调前识别并过滤危险数据,避免安全能力退化。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)