#safety-drift

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Tianqi Xiao, Shiyao Cui, Minghao Zhang, Junxiao Yang, Renmiao Chen

本研究聚焦于多模态大语言模型(MLLM)中一种新的安全风险——跨模态安全漂移。视觉模态虽然增强了模型的能力,但也为攻击者提供了新的利用路径:一段在纯文本场景下看似无害的查询,一旦配上特定的视觉图像,就可能表达出被模型间接解读的恶意意图,而模型往往不会像对明确有害文本那样触发拒答。作者首先通过实证分析,总结了几种典型的不安全响应模式,揭示了这些场景下模型的薄弱环节。随后通过模型表示和注意力机制的可解释性分析,发现视觉上有风险的关键线索仅获得有限的注意力,难以有效触发模型的拒绝行为。基于“文本安全处理中的安全信号可被迁移”这一观察,作者提出了安全感知表示转移(SRT)方法。SRT是一种轻量级、基于方向调整的干预手段,在完全冻结MLLM骨干参数的情况下,通过调整模型内部表示中的安全相关方向,使模型在面对视觉诱发的恶意请求时也能维持正确的安全偏好。多个基准和不同规模模型的实验表明,SRT不仅能在多种跨模态组合中显著提升模型的安全响应率,同时不会明显损害正常任务的处理能力,即保持了实用性。该研究为MLLM安全对齐提供了新视角和一种低成本的可落地方案,并开放了源码。

💡 推荐理由: MLLM正被广泛应用于实际业务,跨模态安全漂移可能会导致模型在不应答的场景下给出有害响应,甚至被用作内容生成攻击的绕过手段。了解该风险并借鉴SRT这类无需重新训练的防御方法,对于企业构建安全审计和护栏至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)