#typographic-attacks

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

该论文首次系统研究了视觉-语言模型(VLM)中遗忘(unlearning)的跨模态迁移问题。现有机器学习遗忘技术主要用于移除大型语言模型中的危险知识,但VLM同时处理文本和视觉输入,遗忘在一个模态中是否会自动迁移到另一个模态是一个关键安全问题。作者在三种主流VLM架构上进行了双向迁移实验:LLaVA-1.5(MLP投影)、InstructBLIP(Q-Former)和IDEFICS(门控交叉注意力)。实验发现遗忘确实会在模态间迁移,但迁移是不对称且不完整的。例如,文本遗忘可以强烈迁移到视觉输入,但这种鲁棒性在排版攻击(typographic attacks)下被破坏,之前遗忘的知识可以轻易恢复,表明存在浅层遗忘。为了解决迁移差距和浅层鲁棒性问题,作者提出了CrossInf,一种基于影响力引导的缓解策略。该方法基于观察:不同模型组件对跨模态迁移的贡献不同,因此将遗忘聚焦于对跨模态泛化影响最大的Transformer块。CrossInf在强融合架构中将迁移差距减少一半以上,同时保持模型效用,并将排版攻击的成功率降至接近零。作者还通过三位标注者的众包评估(κ=0.77)验证了发现,并使用 centered kernel alignment(CKA)分析了浅层遗忘,为观测到的迁移行为和鲁棒性限制提供了见解。

💡 推荐理由: 该研究揭示了VLM遗忘机制的安全漏洞:跨模态迁移不彻底且易被排版攻击绕过,可能导致敏感知识意外恢复。对使用多模态模型的组织有重要安全启示。

🎯 建议动作: 关注后续研究进展,评估自身VLM部署的遗忘机制鲁棒性

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)