#text-summarization

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Poojitha Thota, Shirin Nilizadeh

该论文针对在微调阶段对大型语言模型(LLM)进行数据投毒攻击的防御问题展开研究。在抽象文本摘要任务中,微调数据集通常较小,攻击者可通过操纵少量训练样本,使模型生成有偏见或有害的摘要,同时保持标准评估指标正常。论文提出了一种统一的防御框架,可在模型部署后检测并修复微调阶段的数据投毒。在白盒场景下,被投毒的文档-摘要对表现出异常高的训练影响,通过影响函数分析和语义一致性检查可有效检测。在黑盒场景下,被投毒模型对保持语义的扰动表现出2-3倍的敏感性,可实现无需访问训练数据的行为审计。此外,论文还引入了两种新型攻击:事实扭曲攻击和代表性偏见攻击,证明投毒可改变摘要行为而不触发常规警报。实验基于9种架构和6个基准数据集,在自适应攻击下,检测精度达到85-92%,梯度上升遗忘(unlearning)可恢复高达96%的原始行为,且ROUGE指标下降小于0.6%。研究表明,微调阶段投毒会留下持久的结构性痕迹,使得无需完全重新训练即可实现实用检测和部署后恢复。

💡 推荐理由: LLM在微调阶段面临的数据投毒风险极具隐蔽性,传统防御难以兼顾效果和效率。本文首次提出统一的后验防御方案,兼顾检测与恢复,对AI供应链安全具有重要参考价值。

🎯 建议动作: 研究跟进,考虑在内部LLM微调流水线中集成类似检测与修复机制

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)