#unlearning

共收录 5 条相关安全情报。

← 返回所有主题
👥 作者: Beining Xu, Hairui Wang, Jiaxin Wang, Changsheng Chen, Anirban Chakraborty

本文关注多模态大语言模型(MLLM)在文档理解场景下的隐私泄露问题,尤其是面向身份证件等身份文档处理的领域专用MLLM。作者指出,现有研究多聚焦于通用MLLM的隐私风险,而领域专用模型在关键信息提取(KIE)任务中的独特脆弱性尚未被充分探索。当输入图像缺乏足够的视觉证据时,模型可能依赖训练数据中学到的字段关系来推断缺失内容,从而泄露多个相互关联的敏感字段(如姓名、证件号、地址等),形成关系型隐私泄露。为缓解这一风险,本文提出动态关系遗忘框架(DRUF),包含关系解耦遗忘模块(RDU)和动态集合更新机制,在不显著降低KIE性能的前提下抑制高风险字段对的泄露。同时,作者构建了DocPrivacyBench基准,用于系统评估模型在视觉证据缺失或极少情况下对隐私泄露的敏感性。基于该基准,研究评估了三种MLLM和六种遗忘方法,考察遗忘后的泄露抑制效果与工具实用性保持。实验结果表明,现有MLLM在视觉证据稀缺时普遍存在隐私泄露,且在噪声较大的数据集上更为严重;而DRUF相比最强基线将泄露抑制率提升4.8个百分点,有效缓解隐私风险并保持鲁棒的文档信息提取性能。本文为文档类MLLM的隐私保护提供了新的评估基准和有效的遗忘方法,适合从事多模态模型安全、隐私保护和文档智能处理的研究人员及安全工程师阅读。

💡 推荐理由: 文档MLLM处理身份证件等敏感信息,视觉证据不足时可能产生关系型隐私泄露。本文首个系统评估该风险并提出DRUF遗忘框架,为蓝队评估和防护此类模型提供了可用的基准与方法。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Gabriel Huang, Abhay Puri, Léo Boisvert, Alexandre Drouin, Perouz Taslakian, Spandana Gella, Christopher Pal

本文研究开放权重 LLM 智能体在微调阶段可能被植入后门的安全问题。此类后门在测试阶段若触发条件未满足,可能无法被检测到。由于防御者不知道原始触发条件,无法直接“忘记”该后门。一种去污(decontamination)策略是安装一个已知后门(称为防御性投毒),然后通过“遗忘”(unlearning)清除该已知后门,期望原始未知后门作为副作用被一起移除。然而这一过程的结果不确定:原始后门可能被保留、清除或重定向等。作者提出了一个用于研究工具调用型智能体中这些动态的框架,在 AgentDyn 环境上系统性地解耦了触发条件、响应、教师模型和微调方法。在 115 个实验中,仅防御性投毒就能清除约 56% 的原始后门;随后进行去污处理几乎将所有幸存后门清除,从而证实触发识别和恶意执行在行为上是可分离的。实验还发现,当防御性后门与原始后门属于相同一般类型的触发条件,并接下去污(遗忘)时,恶意后门从未持续存在。同时安装最多四个后门会增加抵抗性(约 36% 被清除),但清除单个已知共驻后门会连带清除 52/60(87%)的共驻后门。通过 J-lens 可视化去污后的模型内部状态,作者确认虽然去污恢复了良性的 LLM 响应,但原始触发条件意识的痕迹仍存在于中间层。这些发现揭示了后门清除的动态特性,为 LLM 智能体安全防护提供了新的理论依据和实验证据。

💡 推荐理由: 该研究为 LLM 智能体后门防御提供了首个系统化动态分析,证明防御性投毒+遗忘能有效清除未知后门,但也揭示内部残留痕迹,对安全评估与审计有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

该论文首次系统研究了视觉-语言模型(VLM)中遗忘(unlearning)的跨模态迁移问题。现有机器学习遗忘技术主要用于移除大型语言模型中的危险知识,但VLM同时处理文本和视觉输入,遗忘在一个模态中是否会自动迁移到另一个模态是一个关键安全问题。作者在三种主流VLM架构上进行了双向迁移实验:LLaVA-1.5(MLP投影)、InstructBLIP(Q-Former)和IDEFICS(门控交叉注意力)。实验发现遗忘确实会在模态间迁移,但迁移是不对称且不完整的。例如,文本遗忘可以强烈迁移到视觉输入,但这种鲁棒性在排版攻击(typographic attacks)下被破坏,之前遗忘的知识可以轻易恢复,表明存在浅层遗忘。为了解决迁移差距和浅层鲁棒性问题,作者提出了CrossInf,一种基于影响力引导的缓解策略。该方法基于观察:不同模型组件对跨模态迁移的贡献不同,因此将遗忘聚焦于对跨模态泛化影响最大的Transformer块。CrossInf在强融合架构中将迁移差距减少一半以上,同时保持模型效用,并将排版攻击的成功率降至接近零。作者还通过三位标注者的众包评估(κ=0.77)验证了发现,并使用 centered kernel alignment(CKA)分析了浅层遗忘,为观测到的迁移行为和鲁棒性限制提供了见解。

💡 推荐理由: 该研究揭示了VLM遗忘机制的安全漏洞:跨模态迁移不彻底且易被排版攻击绕过,可能导致敏感知识意外恢复。对使用多模态模型的组织有重要安全启示。

🎯 建议动作: 关注后续研究进展,评估自身VLM部署的遗忘机制鲁棒性

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaotian Ye, Xiaohan Wang, Mengqi Zhang, Shu Wu

本文深入研究了大型语言模型(LLM)遗忘中的反事实调优(CFT)范式。CFT通过训练模型生成替代的虚构知识来取代不需要的内容,是一种有前景的遗忘方法。然而,作者发现CFT在某些方面仍不如其他遗忘范式,并揭示了两个被忽视的缺陷:(1)知识冲突:反事实语料库内部的相互不一致导致梯度冲突,从而干扰参数优化;(2)幻觉扩散:拟合虚假目标会灌输持久的捏造偏见,增加无关领域的幻觉率。为了系统诊断这些问题,作者引入了RWKU+基准,该基准配备了新的权衡指标和梯度级诊断工具。论文进一步讨论了该范式的局限性和开销,旨在为更严格的LLM遗忘研究提供见解和可操作指导。适合LLM安全研究、模型遗忘技术开发者阅读。

💡 推荐理由: 揭示了LLM遗忘中反事实调优的隐藏成本,为改进遗忘方法提供关键诊断工具。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Wenwei Zhao, Xiaowen Li, Yao Liu, Zhuo Lu

联邦学习(FL)易受到投毒攻击,恶意客户端会上传篡改的模型更新以降低全局模型的性能。现有的检测方法虽能识别并移除恶意客户端,但模型已受污染,仍需恢复。从头再训练虽然有效但成本高昂,而现有的遗忘方法在效果和效率上均不理想。本文提出联邦对抗遗忘(FAUN),一种轻量级框架,仅保留恶意客户端最近一小段更新历史,并利用代理数据集进行对抗优化,生成能消除恶意方向的更新。通过少量遗忘轮次应用这些更新,随后进行良性微调,即可快速移除恶意影响并稳定恢复。在三个经典数据集上的实验表明,FAUN 能达到与再训练相当的恢复效果,且所需轮次大幅减少,攻击成功率降至接近零,证明了 FAUN 成功消除了被遗忘客户端的贡献。

💡 推荐理由: 联邦学习中毒攻击的模型恢复是一个关键但资源密集的问题。FAUN 提供了一种高效、低成本的替代方案,可快速清除恶意影响,对保障 FL 系统安全具有重要实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)