#multimodal-safety

共收录 2 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Haoyu Zhang, Yangyang Guo, Mohan Kankanhalli

该论文提出了一种针对大型视觉语言模型(LVLM)的新型越狱攻击方法,名为信息过载(Information Overloading)。LVLM 在个人助理、文档分析、具身智能等场景广泛应用,但其双模态攻击面(视觉和文本)易受越狱攻击。现有攻击方法通常采用简单设计,如短文本和分布外图像,但随着大语言模型骨架和多模态机制的进步,这些攻击的可迁移性显著下降。为克服此限制,作者提出同时利用扩展文本和多维图像攻击的信息过载方法。具体而言,该方法通过递归式图像-排版布局,将文本和图像攻击组件组合,指数级增加多模态信息复杂度。这种过载方式放大了所需的跨模态处理,从而破坏 LVLM 的安全对齐。在开源和商业 LVLM 上的大量实验表明,该方法达到了最先进的越狱攻击效果:开源模型平均攻击成功率(ASR)为 88.6%,商业 LVLM 平均 ASR 为 84.0%,超过最佳基线 48.7%。此外,在开源替代模型上优化的提示能够有效跨模型族迁移。实验还通过探测受害 LVLM 中安全关键信息流,发现复杂的图像-排版组合会引发强化的跨模态处理,并降低模型生成拒绝响应的确定性。这些发现凸显了信息过载作为实际且新兴的安全风险,需要针对复杂多模态越狱输入加强防御。

💡 推荐理由: 该攻击揭示了当前LVLM安全对齐在复杂多模态输入下的脆弱性,信息过载可绕过大多数现有防御,对实际部署的视觉语言模型构成严重威胁,值得安全从业者高度关注。

🎯 建议动作: 关注该攻击模式,评估内部LVLM模型的安全性,研究针对复杂多模态越狱输入的防御策略。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jiaxian Lv, Shiyao Cui, Yingkang Wang, Guoxin Wu, Qingling Zhang, Minlie Huang

本研究聚焦于多图像内容中一种新型安全威胁——多图像隐式毒性(MIIT)。MIIT指的是每张图片单独看起来无害,但当多张图片被联合解读时,会产生有害语义。这种威胁在社交媒体中日益普遍,但现有的商业内容审核API和模型因缺乏每张图片中的显式风险线索而难以应对。本文首先给出了MIIT的形式化定义,并分析了检测该威胁的三个关键挑战:隐式语义组合、上下文依赖性和缺乏标注数据。为缓解数据稀缺问题,研究者通过自动化生成管道构建了MIIT-dataset,这是一个仅包含图像的多图像安全数据集,涵盖七个代表性风险类别(如仇恨言论、暴力、性暗示等)。在此基础上,他们提出了MiShield模型,该模型通过渐进式蒸馏推理监督进行训练,能够生成安全判断并附带有害相关实体的显式分析。实验表明,MiShield-8B模型在MIIT检测任务上优于代表性审核服务(如Google Cloud Vision、Amazon Rekognition)甚至更大规模的模型(如Gemini、GPT-4V),揭示了该模型对于这一广泛使用的视觉格式的有效性和实用价值。该论文同时也包含潜在敏感内容,警告读者注意。

💡 推荐理由: MIIT揭示了传统单图审核的盲区,多图组合可能传播隐蔽有害信息,威胁社交媒体内容安全。相关方需警惕此类隐式毒性并改进审核策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)