#vision-language-model

共收录 7 条相关安全情报。

← 返回所有主题
👥 作者: Haoran Chang, Mingzhe Chen, Qianqian Zhang

本文针对无线边缘网络中语义通信的隐私泄露问题,提出了一种基于视觉语言模型(VLM)的隐私保护语义通信框架。传统语义通信通过传输高层语义特征而非原始比特来提升频谱效率,但多设备协作和跨模态传输会通过设备间语义融合和跨模态表示泄露敏感信息。为此,作者设计了一个边缘服务器维护的隐私数据库,VLM从中提取图像中的文本语义并识别隐私敏感实体。每个设备在传输图像前,先移除被标记的隐私区域,同时保留有用语义内容;服务器端则利用文本嵌入和VLM语义先验,从接收到的掩码图像中重建被移除的区域。为了保护文本信息,作者利用无线信道的互易性生成物理层密钥,设计了无需预共享密钥的加密语义信道收发机。此外,引入语义信息瓶颈来抑制多设备间的冗余信息。评估部分针对一个强大的模型感知对手(可窃听无线传输并获取边缘设备模型参数,但无法访问服务器端数据)进行了仿真。结果表明,与无隐私保护的语义通信方案相比,该方法将隐私泄露降低了50%以上;同时,授权服务器在感知重建质量上比攻击者提高了48%。估计的传输表示与原始数据的互信息接近0比特,说明有效抑制了跨设备的语义冗余。该研究为无线边缘网络中的多模态语义通信提供了隐私保护新思路,适合语义通信、边缘智能和隐私计算方向的研究人员阅读。

💡 推荐理由: 语义通信是6G候选技术,本文首次将VLM用于边缘语义通信的隐私保护,通过物理层密钥和语义瓶颈实现可量化的隐私增益,对无线边缘场景下的数据安全设计有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi

该论文研究视觉语言系统(VLM)在基于答案保留的攻击下置信度读数的鲁棒性。作者提出一个信息性-可操作性边界(informativeness-manipulability frontier),用于刻画攻击者在保持生成答案逐字节不变的前提下,能够操纵模型置信度输出的程度。在可到达性假设下,不可移动的置信度读数无法胜过答案字符串准确率先验(合并值为0.617)。独立于该假设,低于可测阈值的均匀幅值证书可保证对抗性判别高于同一底线。作者在四个视觉语言模型、三个视觉问答基准、五个部署置信度通道和两个防御估计器上进行了实验,发现直接或代理攻击能产生逐项可行的扰动,并在所有84个估计器-单元组合中反驳该统一证书。进一步,协调的正确性标签感知攻击将对抗性判别降至或低于答案字符串底线,在所有60个部署通道单元中均如此,包括59个初始高于该底线的单元。隐藏状态干预和开放文本模型激活空间复制表明,类似的置信度移动可在表示层面诱导,而不仅依赖对抗图像。测试的四个防御家族在各自评估下均未建立稳健替代方案。在置信度门控模拟中,协调的token概率攻击转移到隐藏状态门控后,高达84.8%的先前被拒绝的错误答案被接受;按基准自然正确率重新加权后,转移场景下12个单元中有8个、直接门控攻击下所有12个单元的接受准确率均低于无门控基线。结论是:在所研究的威胁模型和预算下,置信度是完整性敏感的监督信号,而非内在稳健的信号。该工作适合研究对抗鲁棒性、VLM安全、以及依赖置信度过滤的部署者阅读。

💡 推荐理由: 许多实际系统将置信度作为拒绝低质量答案的门控信号,该研究揭示攻击者可在不改变答案的情况下操纵置信度,导致门控失效。对依赖VLM安全过滤的蓝队而言,这意味着置信度本身不可作为可靠防线,需引入额外校验机制。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Zijian Xiao, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita

该论文针对视觉语言模型(VLM)的安全防御问题,指出现有安全分类器(guard)作为主要黑盒防御手段,仅审查输入的表面形式而忽略其语义,导致恶意请求可以通过集合论、形式逻辑、罕见语言、代码或文本图像等编码方式绕过guard,形成“解码差距”。为了弥补这一缺口,作者提出了一个guard无关的“恢复-解码-重新守护”(Recover, Decode, Reguard)放大模块,在guard之前将图像内容转录并将编码文本还原为明文请求,使任何现成的分类器都能筛查真实意图。评估采用最严苛的攻击者假设:一个由十一种攻击组成的集合,只要任一攻击成功即判定为行为被击破(best-of-suite,遵循AutoAttack),这在越狱防御研究很少被报告。实验覆盖五个guard与两个目标VLM,结果显示:无防御时集合攻击可突破89-91%的行为;即使加上放大模块,最佳guard仍留下63-65%的失败率,且相对于单独使用guard,仅在十个guard-目标组合中有四个显著增益。进一步添加模块化的重新守护层可弥补大部分残余风险,但会使校准良好的guard对良性输入的过度拒绝率升至81-92%;而唯一保持可用性的宽松guard又无法达到部署级安全性(集合攻击成功率48%)。总之,在所研究的流水线以及针对表示转换攻击(即编码和跨模态渲染,留下可读载荷,而非像素或嵌入级攻击)下,没有任何配置能同时实现低攻击成功率和低过度拒绝。论文贡献包括:提出该放大模块、采用集合评估使安全-效用权衡可见,并绘制了基于恢复的VLM防御的有效区域与失效边界。

💡 推荐理由: 该研究揭示了当前VLM安全防御在编码攻击下的根本性缺陷,证明仅靠分类器表面检查无法保证安全,并给出可复现的集合评估方法,帮助蓝队理解安全与可用性的权衡。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohammed Aldeen, Muhammad Sami Irfan, Sagar Dasgupta, Long Cheng, Mizanur Rahman, Mashrur Chowdhury

该论文针对自动驾驶汽车(AV)依赖全球导航卫星系统(GNSS)进行定位和导航,易受欺骗攻击(如轨迹重定向、急停等)的问题,提出了首个基于视觉-语言模型(VLM)的GNSS欺骗检测框架。方法创新地融合了前置摄像头视觉数据与车载传感器读数(速度、加速度、偏航率),并与GNSS导出的机动行为进行对比。作者设计了三阶段微调流程:首先对齐视觉线索,然后在共享语义空间中校准传感器数据,以检测在三种攻击场景下预测机动与GNSS导出机动之间的差异。为验证模型跨区域泛化能力,团队在阿拉巴马州塔斯卡卢萨县公共道路上采集了实车数据集(含时间同步的GNSS、IMU和相机日志),并生成了智能欺骗攻击样本,包括带道路网络匹配的轨迹镜像(错误转弯攻击)、位置冻结(过冲攻击)和漂移生成(停车攻击)。实验表明:零样本VLM基线F1分数仅为23%-32%,而微调后的模型F1分数达到94%-95%;错误转弯和停车攻击分类准确率100%,过冲攻击准确率88%-93%。此外,引入自适应推理策略将VLM调用次数降至14%(计算量减少约86%),每4秒窗口处理时间为65-73毫秒,证明了该方法作为实际道路上补充信号级完整性检查的防御层的可行性。

💡 推荐理由: 首次将VLM应用于自动驾驶GNSS欺骗检测,通过多模态融合实现高精度(>94% F1)且低计算开销(86%推理减少),为自动驾驶安全提供了新颖的感知级防御思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xingwei Zhong, Varun Sharma, Kar Wai Fok, Vrizlynn L. L. Thing

本文提出 DE-FIVE,一种无需重新训练的全新框架,用于检测针对视觉语言模型(VLM)的恶意图像提示。VLM 结合视觉和文本模态,但视觉模态的引入扩大了攻击面,例如对抗扰动和间接提示注入攻击,这些攻击通过精心构造的恶意图像提示诱导模型产生意外输出。现有防御方法通常需要大量数据集重新训练或部署额外复杂分类器,且缺乏专门针对间接提示注入的防御机制。DE-FIVE 利用傅里叶域特征和视觉编码器的隐藏状态表示(图像向量嵌入)实现混合检测策略:黑盒检测器基于傅里叶域特征,白盒检测器利用少量恶意样本导出的图像向量嵌入。实验结果表明,DE-FIVE 在检测恶意图像提示方面持续优于现有最先进基线。主要贡献包括:提出一种无训练、高效的检测框架;融合傅里叶特征和嵌入特征;设计黑盒和白盒双检测器;在标准数据集上验证有效性。本文适合从事 VLM 安全、对抗攻击防御和提示注入检测的研究人员阅读。

💡 推荐理由: 恶意图像提示攻击对 VLMs 构成严重威胁,现有防御不足。DE-FIVE 提供无需训练、高效的检测方案,填补了间接提示注入防御的空白。

🎯 建议动作: 研究跟进,评估框架在自身VLM环境中的适用性

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hao Yang, Zhuo Ma, Yang Liu, Yilong Yang, Guancheng Wang, JianFeng Ma

本文提出一种针对大型视觉语言模型(LVLMs)的新型跨模态提示注入攻击方法CrossMPI。传统提示注入攻击通常局限于单一模态(如仅文本或仅图像),无法实现跨模态的提示扰动,即注入的提示只能影响模型对单一输入的解释。CrossMPI通过图像仅扰动实现跨模态注入,能够同时操纵模型对文本和视觉输入的解释。其核心创新在于将注入提示的扰动优化目标从视觉嵌入空间(约10^5参数)转向模型隐藏状态空间(约10^7参数),该空间负责多模态信息整合,从而增强攻击效果。为解决大参数空间优化带来的挑战,作者提出两项策略:一是层选择策略,识别对多模态整合最关键的网络层;二是距离递减扰动预算分配策略,根据像素与语义关键区域的距离递减分配扰动预算。实验表明,该方法在多个LVLMs和数据集上显著优于基线方法。本文揭示了LVLM在跨模态安全性方面的潜在漏洞,适合安全研究人员、多模态AI开发者及对抗攻击研究者阅读。

💡 推荐理由: 该研究首次实现仅通过图像扰动就能同时影响LVLM对文本和图像的解释,拓展了提示注入的攻击面,对多模态AI系统的安全部署构成威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ahmad Albarqawi, Mahmoud Nazzal, Issa Khalil, Abdallah Khreishah, NhatHai Phan

随着深度伪造技术的快速发展,生成逼真的虚假数字内容对媒体真实性构成严重威胁。传统的深度伪造检测方法在面对定制化、复杂的深度伪造时,泛化能力和鲁棒性往往不足。本文提出了一种名为ViGText的新方法,该方法创新地将图像与视觉大语言模型(VLLM)的文本解释相结合,并基于图神经网络(GNN)框架进行深度伪造检测。ViGText的核心在于利用详细的解释文本而非简单的标题,提供更丰富的上下文信息,从而捕捉细微的不一致性。具体而言,ViGText将图像划分为多个补丁,分别构建图像图和文本图,并通过GNN整合分析。方法还采用了跨空间域和频率域的多级特征提取,以增强对复杂深度伪造的检测鲁棒性。大量实验表明,ViGText在泛化性能上显著提升:在泛化评估中,平均F1分数从72.45%提升至98.32%;面对用户定制化的稳定扩散模型变体时,表现出优异的泛化能力。鲁棒性方面,ViGText的召回率相比其他方法提升了11.1%。针对利用其图架构的定向攻击,ViGText将分类性能下降限制在4%以内。本研究为深度伪造检测设立了新标准,有助于维护媒体真实性和信息完整性。

💡 推荐理由: ViGText结合视觉语言模型与图神经网络,显著提升了深度伪造检测的泛化能力和鲁棒性,为安全团队应对日益复杂的AI生成虚假内容提供了新思路。

🎯 建议动作: 研究跟进,评估将ViGText集成到现有深度伪造检测管道的可行性。

排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)