#multimodal-security

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Jaechul Roh, Deepak Chandran, Amir Houmansadr, Andrea Fanelli

该论文关注全双工语音模型(full-duplex speech models)带来的一个被忽视的攻击面:这类模型在生成回复的同时仍持续接收用户语音输入,因此攻击者可以在模型「说话」期间通过用户音频通道插入额外的语音内容,从而与当前对话轮次解耦地影响模型行为。作者提出 DuplexJail 这一测试框架,其核心特点是所注入的语音提示是固定的、与具体有害请求内容无关(request-independent),即不依赖针对每个请求定制话术,而是考察「在不当时间点插入语音」这一交互结构本身能否破坏安全对齐。研究设计了两种注入时机策略进行对照:其一为固定延迟中断,即在有害请求音频播放结束后延迟一段时间插入提示;其二为拒答触发中断,即持续监测模型流式文本输出,一旦出现拒答线索(cue)便立即插入提示,属于对模型自身输出状态的自适应触发。实验覆盖四个开源全双工语音模型,并使用 AdvBench 与 HarmBench 共 720 条有害请求作为评测集,以整段回复(whole-response)为粒度统计攻击成功率。结果显示,固定延迟策略在 AdvBench 上把 PersonaPlex 的成功率推高到 40.3%、PersonaPlex-RL 推高到 48.7%,相对基线分别提升 33.8 与 39.3 个百分点;拒答触发策略在这两个模型上分别达到 35.6% 与 48.6%。值得注意的是,所有试验无论是否真的发生中断都被计入评分,保证了评估口径的一致性。此外,部分条件下 FLM-Audio 的有害回复率同样上升,而 BayLing-Duplex 则出现下降,说明不同架构对语音中断的鲁棒性差异显著。论文的主要贡献在于:首次把「语音中断」形式化为一种越狱攻击向量;给出可复现的评测方法与跨模型对比数据;并主张安全评估必须覆盖全双工交互的「进行中」状态,而非仅评估一轮一轮的静态对话。适合语音大模型研发、模型安全对齐、红队评测及多模态安全治理方向的研究者与工程师阅读。

💡 推荐理由: 当前多数语音助手安全评测仍沿用「一轮请求—一轮回复」的静态范式,而全双工模型的持续收音特性使攻击者能在生成过程中插话,且无需定制话术即可显著提升越狱成功率。这提示现有对齐与拒答机制在真实交互时序下可能失效,安全评估与上线门槛需相应调整。

🎯 建议动作: 研究跟进:将该测试范式纳入内部语音模型安全评估清单,优先对具备全双工能力的在研/在用模型做时序化回归测试

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Bangshuo Zhu, Wei Song, Yuxin Cao, Yuezhong Wu, Zhiquan Liu, Yuekang Li, Jingling Xue

本文研究视频大语言模型(VideoLLMs)在安全攸关场景(如内容审核、视频分析)中面临的观察级攻击(observation-level attacks)防御问题。VideoLLMs 为高效处理长视频,通常依赖帧采样、令牌压缩和模态融合等组成的观测流水线,将原始视频压缩为紧凑的内部表示。已有的观察级攻击可利用该流水线,使模型无法感知有害内容,但目前尚无专门针对此类威胁设计的防御方法。为此,作者提出 DefTEval,一个受控评估框架,系统性地检验输入级对抗防御(即对已采样帧的像素内容进行操作的防御)能否缓解观察级攻击。在五个 VideoLLM、十一种代表性防御方法和五种攻击类型下,实验发现输入级防御提供的保护有限且不一致,有害内容检出率常接近零。关键的是,即使攻击将有害信号嵌入每个采样帧,防御仍然失效,说明瓶颈不仅在于采样遗漏,还在于进入模型的信号被抑制。令牌压缩会丢弃局部特征,而模态融合会系统地降低被削弱的视觉信号的权重。此外,防御有效性主要由模型架构决定,而非防御方法本身;且不同内容类别间的检出率差异巨大,暴露了时间推理的结构性弱点。这些发现表明,保护 VideoLLM 需要系统级鲁棒性机制,涵盖感知采样的覆盖保证、安全相关特征的令牌级保留以及模态平衡的融合。本文适合关注多模态大模型安全、对抗鲁棒性以及视频内容审核系统的安全研究者、蓝队工程师和模型开发者阅读。

💡 推荐理由: VideoLLM 正被用于内容审核等安全关键场景,但现有防御仅针对像素级对抗样本,无法有效抵御针对模型观测流水线的攻击。本文揭示架构级别的安全盲区,对蓝队设计多模态系统防护具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)