#multimodal-learning

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Mengyuan Sun 0001, Yu Li 0006, Yunjie Ge, Yuchen Liu, Bo Du 0001, Qian Wang 0002

多模态对比学习模型(如CLIP)凭借出色的视觉-语言对齐能力,已广泛用作大规模多模态系统的核心基础组件。然而,这类模型极易遭受后门攻击:攻击者可向训练数据注入隐蔽触发器,使模型在推理时遇到特定图案便产生恶意输出,且后门效应会沿下游任务传播,构成重大安全威胁。针对现有防御方法的不足——通常需要已知攻击目标或访问中毒数据集、依赖大量干净数据,实际部署受到严格限制——本文提出 InverTune,一个在最小攻击者假设下工作的新型后门防御框架。它既不预先知道攻击目标,也无需使用训练阶段的中毒数据集。InverTune 的核心流程包含三个关键组件:(1) 通过对抗模拟暴露攻击签名,利用模型响应模式概率性地识别目标标签;(2) 基于该标签推断,采用梯度反演技术分析神经元激活模式,重建潜在触发器;(3) 设计聚类引导的微调策略,仅借助少量任意干净数据即可擦除后门功能,同时保持原始模型的任务性能。实验部分针对多种最先进的攻击方法进行验证,结果显示 InverTune 平均将攻击成功率(ASR)降低 97.87%,而干净准确率(CA)仅下降 3.07%。该工作为多模态安全防护开辟了新范式,证明了在不牺牲模型能力的前提下可有效抵御后门注入,为基础模型的安全部署提供了可行路径。适合关注多模态模型安全、后门防御及基础设放稳健性的安全研究员和算法工程师阅读。

💡 推荐理由: 对使用CLIP等多模态基础模型的企业和安全团队而言,InverTune提供了一种无需攻击先验或大量干净数据的后门防御方案,解决了现有方法实用性差的痛点,有助于在真实部署中对抗后门注入,降低模型供应链与部署风险。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)