推荐 5.5
Conf: 50%
本文研究视频大语言模型(VideoLLMs)在安全攸关场景(如内容审核、视频分析)中面临的观察级攻击(observation-level attacks)防御问题。VideoLLMs 为高效处理长视频,通常依赖帧采样、令牌压缩和模态融合等组成的观测流水线,将原始视频压缩为紧凑的内部表示。已有的观察级攻击可利用该流水线,使模型无法感知有害内容,但目前尚无专门针对此类威胁设计的防御方法。为此,作者提出 DefTEval,一个受控评估框架,系统性地检验输入级对抗防御(即对已采样帧的像素内容进行操作的防御)能否缓解观察级攻击。在五个 VideoLLM、十一种代表性防御方法和五种攻击类型下,实验发现输入级防御提供的保护有限且不一致,有害内容检出率常接近零。关键的是,即使攻击将有害信号嵌入每个采样帧,防御仍然失效,说明瓶颈不仅在于采样遗漏,还在于进入模型的信号被抑制。令牌压缩会丢弃局部特征,而模态融合会系统地降低被削弱的视觉信号的权重。此外,防御有效性主要由模型架构决定,而非防御方法本身;且不同内容类别间的检出率差异巨大,暴露了时间推理的结构性弱点。这些发现表明,保护 VideoLLM 需要系统级鲁棒性机制,涵盖感知采样的覆盖保证、安全相关特征的令牌级保留以及模态平衡的融合。本文适合关注多模态大模型安全、对抗鲁棒性以及视频内容审核系统的安全研究者、蓝队工程师和模型开发者阅读。
💡 推荐理由: VideoLLM 正被用于内容审核等安全关键场景,但现有防御仅针对像素级对抗样本,无法有效抵御针对模型观测流水线的攻击。本文揭示架构级别的安全盲区,对蓝队设计多模态系统防护具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)