#unlearning

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

该论文首次系统研究了视觉-语言模型(VLM)中遗忘(unlearning)的跨模态迁移问题。现有机器学习遗忘技术主要用于移除大型语言模型中的危险知识,但VLM同时处理文本和视觉输入,遗忘在一个模态中是否会自动迁移到另一个模态是一个关键安全问题。作者在三种主流VLM架构上进行了双向迁移实验:LLaVA-1.5(MLP投影)、InstructBLIP(Q-Former)和IDEFICS(门控交叉注意力)。实验发现遗忘确实会在模态间迁移,但迁移是不对称且不完整的。例如,文本遗忘可以强烈迁移到视觉输入,但这种鲁棒性在排版攻击(typographic attacks)下被破坏,之前遗忘的知识可以轻易恢复,表明存在浅层遗忘。为了解决迁移差距和浅层鲁棒性问题,作者提出了CrossInf,一种基于影响力引导的缓解策略。该方法基于观察:不同模型组件对跨模态迁移的贡献不同,因此将遗忘聚焦于对跨模态泛化影响最大的Transformer块。CrossInf在强融合架构中将迁移差距减少一半以上,同时保持模型效用,并将排版攻击的成功率降至接近零。作者还通过三位标注者的众包评估(κ=0.77)验证了发现,并使用 centered kernel alignment(CKA)分析了浅层遗忘,为观测到的迁移行为和鲁棒性限制提供了见解。

💡 推荐理由: 该研究揭示了VLM遗忘机制的安全漏洞:跨模态迁移不彻底且易被排版攻击绕过,可能导致敏感知识意外恢复。对使用多模态模型的组织有重要安全启示。

🎯 建议动作: 关注后续研究进展,评估自身VLM部署的遗忘机制鲁棒性

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaotian Ye, Xiaohan Wang, Mengqi Zhang, Shu Wu

本文深入研究了大型语言模型(LLM)遗忘中的反事实调优(CFT)范式。CFT通过训练模型生成替代的虚构知识来取代不需要的内容,是一种有前景的遗忘方法。然而,作者发现CFT在某些方面仍不如其他遗忘范式,并揭示了两个被忽视的缺陷:(1)知识冲突:反事实语料库内部的相互不一致导致梯度冲突,从而干扰参数优化;(2)幻觉扩散:拟合虚假目标会灌输持久的捏造偏见,增加无关领域的幻觉率。为了系统诊断这些问题,作者引入了RWKU+基准,该基准配备了新的权衡指标和梯度级诊断工具。论文进一步讨论了该范式的局限性和开销,旨在为更严格的LLM遗忘研究提供见解和可操作指导。适合LLM安全研究、模型遗忘技术开发者阅读。

💡 推荐理由: 揭示了LLM遗忘中反事实调优的隐藏成本,为改进遗忘方法提供关键诊断工具。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Wenwei Zhao, Xiaowen Li, Yao Liu, Zhuo Lu

联邦学习(FL)易受到投毒攻击,恶意客户端会上传篡改的模型更新以降低全局模型的性能。现有的检测方法虽能识别并移除恶意客户端,但模型已受污染,仍需恢复。从头再训练虽然有效但成本高昂,而现有的遗忘方法在效果和效率上均不理想。本文提出联邦对抗遗忘(FAUN),一种轻量级框架,仅保留恶意客户端最近一小段更新历史,并利用代理数据集进行对抗优化,生成能消除恶意方向的更新。通过少量遗忘轮次应用这些更新,随后进行良性微调,即可快速移除恶意影响并稳定恢复。在三个经典数据集上的实验表明,FAUN 能达到与再训练相当的恢复效果,且所需轮次大幅减少,攻击成功率降至接近零,证明了 FAUN 成功消除了被遗忘客户端的贡献。

💡 推荐理由: 联邦学习中毒攻击的模型恢复是一个关键但资源密集的问题。FAUN 提供了一种高效、低成本的替代方案,可快速清除恶意影响,对保障 FL 系统安全具有重要实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)