推荐 5.6
Conf: 50%
多模态大语言模型(MLLMs)在处理文本输入时往往能正确拒绝不安全内容,但对语义等价的多模态输入(如图像+文本)却可能生成有害响应。现有防御手段要么依赖外部护栏,增加推理开销且无法修复模型内在缺陷;要么采用安全微调,但这种黑盒优化可能牺牲模型效用或需要大量多模态数据集。本文旨在探究这种安全差异的根本原因,作者对 MLLM 的表示进行了几何分析,发现从文本中学习到的安全机制可以跨模态保持:模型中存在一个共享的安全子空间和拒绝边界,落入该边界的表示会触发拒绝。然而,不安全的多模态输入会发生表示偏移,使大部分样本落在该边界之外,从而绕过模型固有的安全机制。这表明多模态安全退化源于表示错位,而非安全能力的缺失。基于此发现,作者提出 MMAligner 防护方法,将不安全的多模态表示校准到预先存在的拒绝区域。MMAligner 采用硬下界确保拒绝,软上界避免过度修改,并加入针对良性输入的保留目标。在多个开源 MLLM 上的实验表明,MMAligner 能将不安全多模态输入的平均拒绝率提升至 99%,效用下降不到 2%,且所需训练数据极少,相比现有基线显著改善了安全性与效用的权衡。该研究为多模态大模型的安全对齐提供了新的几何解释与轻量级解决方案。
💡 推荐理由: 该研究揭示了多模态大模型安全失守的根因是表示错位而非能力缺失,为不依赖外部护栏的轻量级防御提供了新思路,对当前多模态应用的安全防护具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)