推荐 10.5
Conf: 50%
多模态大语言模型(MLLM)在用户端应用中日益普及,但其构建流程可能引入后门风险:触发器可能位于图像、文本或两者中。现有面向传统分类器的模型级后门移除方法对 MLLM 效果有限,而针对 MLLM 的防御大多在推理时进行,通过过滤可疑输入来缓解风险,并未真正移除模型内嵌的后门。为从源头消除 MLLM 中的潜在后门,本文提出 RACER(Region-Aware Consistency Repair)框架,其核心观察是:后门会导致内部表示在层间演化出现异常,作者称之为“层间不一致性异常”。该异常具有模态依赖性,主要集中在编码触发器特征的 token 区域。RACER 将融合表示分解为视觉和文本 token 区域,分别对其层间不一致性进行归一化,并在深层窗口上使用模态感知权重重组,形成区域感知的不一致性目标,从而更精确地捕获局部后门异常。通过最小-最大优化,该目标驱动最坏情况扰动合成和对抗微调,抑制后门行为依赖的深层表示方向性偏移。RACER 仅需 100 个干净样本,无需知道触发器、攻击目标甚至模型是否包含后门。在三个开源 MLLM、覆盖图像/文本/多模态触发器的 36 种后门设置中,RACER 将平均攻击成功率(ASR)降至 1.1%,其中 32 种设置达到 0%,同时保持后门模型和干净模型的干净任务效用。该方法为 MLLM 模型级后门修复提供了新思路。
💡 推荐理由: MLLM 后门威胁日益严峻,现有防御多在推理层过滤,无法根除。RACER 提出首个模型级修复框架,仅需少量干净样本即可有效清除后门,为安全从业者提供了治理 MLLM 原生风险的可行方案。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)