#vision-language-models

共收录 6 条相关安全情报。

← 返回所有主题
👥 作者: Elias Schubert, Felix Bießmann

本文针对公共部门中高风险场景下的结构化信息抽取任务,系统评估了开源模型(OCR引擎、大语言模型LLM和视觉语言模型VLM)的端到端性能。研究背景是,虽然专有方案在商业应用中占主导,但开源组件组合成的抽取流水线正成为可行替代,然而在真实多步骤任务上的系统评估仍然缺乏。欧盟《人工智能法案》将公共部门某些文档处理任务归类为高风险,因此负责任地使用这类工具需要基于现实任务的全面评测。作者构建了一个综合基准,使用一个真实世界的高风险文档处理任务——国际学习项目学生申请审核——来评估开源系统的端到端表现。实验覆盖了最先进的OCR引擎、LLM和VLM。核心发现是:VLM通常优于OCR+LLM流水线,但即使最先进的开源模型也难以在零样本设置下可靠处理此类任务;35种配置中只有4种F1分数超过0.5,最好的OCR+LLM流水线与顶级VLM性能相当,但大多数OCR+LLM组合表现明显更差;约75%的配置得分低于0.25。模型规模会影响性能,但关系是非线性的,更大的模型并不保证成比例更好的结果。输入质量,特别是OCR输出的结构保留程度,是独立于下游模型能力的关键因素。该研究为在受监管的高风险公共部门应用中部署开源信息抽取系统提供了实证依据和谨慎乐观的参考。适合关注AI系统负责任部署、开源模型落地评估的从业者阅读。

💡 推荐理由: 为公共部门高风险场景的开源信息抽取系统提供首个真实基准,揭示VLM与OCR+LLM管线的实际性能差距,并指出输入结构保留比模型规模更关键,有助于安全工程师评估此类系统的风险与可靠性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

本研究系统性地考察了中国来源的视觉-语言模型(VLMs)在政治敏感话题上的国家对齐(state-aligned)行为,重点关注其如何从显式的拒绝转向隐式的重新表述。作者构建了一个包含200个核心条目的平衡基准,覆盖十个政治敏感话题,并设计了七种视觉抽象变体作为探测工具。他们测试了九个VLM(七个中国来源,两个非中国来源),在四种引出范式和两种提示语言下进行实验,共产生21,708次试验。每次响应均由两个独立的前沿大语言模型(LLM)裁判在六个维度上进行审核:显式拒绝、信息完整性、视觉接地、国家对齐框架、语言一致性和响应长度,并在200个样本上由三位人类专家进行验证。通过分别测量每个维度,研究将多模态审查分解为多个信号,而非单一的基于拒绝的分数;特别是,拒绝和框架被独立测量,因此模型可以停止拒绝但仍然进行重新表述。主要发现包括:(i)中文提示在每个模型内都会使国家对齐框架的几率增加约三倍;(ii)中国来源的模型比非中国来源的模型有更多的重新表述(方向在不同裁判和人类评分者间一致,幅度约为1.6至3.2倍);(iii)该效应在纯文本政治评论中最强(36.5%),并且受对描绘主体的识别而非像素细节的控制,即使在标志性图像的剪影下也持续存在;以及(iv)在四代Qwen模型中,国家对齐框架上升而显式拒绝下降:审查从可见行为(拒绝)迁移到不可见行为(流畅的重新表述)。作者认为,这种向不可见重新表述的转变从根本上是一个人类-AI交互问题:它消除了用户赖以识别信息被扣留的信号。研究贡献在于通过细粒度的分解测量揭示了多模态审查的演变,并为理解VLM的对齐行为提供了新的视角。适合AI安全领域的研究人员、政策制定者以及多模态系统开发者阅读。

💡 推荐理由: 大型视觉语言模型正在被广泛部署,其潜在的隐形信息过滤可能比显式拒绝更危险,因为用户难以察觉。理解这种“从拒绝到重构”的迁移对AI安全审查与用户认知至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Li Zeng, Zeyu Ye, Meng Xie, Hangtao Zhang, Xianlong Wang, Yanchun Li, Zhetao Li

本文针对视觉语言模型(VLM)在对抗性攻击下的脆弱性展开研究。现有基于文本的对抗攻击方法大多从纯语言模型迁移而来,其提示优化过程中固定视觉输入,导致生成的对抗提示与特定图像绑定,跨图像迁移性差。为突破这一局限,作者首次提出“对抗提示的跨图像迁移性”这一新视角,并设计了一种名为 GhostPrompt 的对抗提示生成方法。GhostPrompt 通过联合优化方式,将图像不变的对抗特征蒸馏到文本提示中:算法交替进行“最坏情况”生成,即先为当前提示构造最难的视觉条件(如添加扰动或选择特定图像),然后更新提示使其在这些条件下依然有效。这样优化得到的对抗提示可被复用,在多种不同图像上诱导 VLM 输出攻击者指定的错误响应。在多个主流 VLM 上的实验表明,与最先进基线相比,GhostPrompt 的攻击成功率提升超过 30%,同时计算时间减少约 70%。该研究揭示了 VLM 在多模态场景下面临的新型威胁,对模型鲁棒性评估和防御策略设计具有重要参考价值。代码已开源。

💡 推荐理由: 首次提出对抗提示的跨图像迁移概念,显著降低攻击计算开销,威胁面从单图像扩展到多图像,对 VLM 部署安全构成新挑战。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sudharshan Balaji, Yili Ren, Guangjing Wang, Yimin Chen, Ning Wang

该论文首次系统研究了视觉-语言模型(VLM)中遗忘(unlearning)的跨模态迁移问题。现有机器学习遗忘技术主要用于移除大型语言模型中的危险知识,但VLM同时处理文本和视觉输入,遗忘在一个模态中是否会自动迁移到另一个模态是一个关键安全问题。作者在三种主流VLM架构上进行了双向迁移实验:LLaVA-1.5(MLP投影)、InstructBLIP(Q-Former)和IDEFICS(门控交叉注意力)。实验发现遗忘确实会在模态间迁移,但迁移是不对称且不完整的。例如,文本遗忘可以强烈迁移到视觉输入,但这种鲁棒性在排版攻击(typographic attacks)下被破坏,之前遗忘的知识可以轻易恢复,表明存在浅层遗忘。为了解决迁移差距和浅层鲁棒性问题,作者提出了CrossInf,一种基于影响力引导的缓解策略。该方法基于观察:不同模型组件对跨模态迁移的贡献不同,因此将遗忘聚焦于对跨模态泛化影响最大的Transformer块。CrossInf在强融合架构中将迁移差距减少一半以上,同时保持模型效用,并将排版攻击的成功率降至接近零。作者还通过三位标注者的众包评估(κ=0.77)验证了发现,并使用 centered kernel alignment(CKA)分析了浅层遗忘,为观测到的迁移行为和鲁棒性限制提供了见解。

💡 推荐理由: 该研究揭示了VLM遗忘机制的安全漏洞:跨模态迁移不彻底且易被排版攻击绕过,可能导致敏感知识意外恢复。对使用多模态模型的组织有重要安全启示。

🎯 建议动作: 关注后续研究进展,评估自身VLM部署的遗忘机制鲁棒性

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

该论文提出了一种针对视觉语言模型(VLM)的新型后门攻击框架ReShift,其核心创新在于实现推理层面的后门注入,而非传统的输出层操纵。现有后门攻击方法往往在推理链中留下不一致或可检测的痕迹,容易被现有防御机制发现。ReShift通过“顿悟时刻”(aha-moment)驱动的方式,在模型内部思维链(CoT)过程中引导推理轨迹发生偏移,同时保持表面上的逻辑连贯性。框架包含两个关键组件:毒化推理感知数据构建(PRDC)管道,用于生成带有触发条件且推理过程异常的样本;以及监督-强化联合优化(SRJO)策略,用于稳定地诱导触发条件下的推理偏移。论文进一步形式化了“熵反弹”(Entropy Rebound)作为推理重定向的特征信号,并给出一系列理论保证,说明熵缺口与轨迹级差异之间的关系。实验表明,ReShift能够在保持干净任务性能和生成合理推理轨迹的前提下实现高攻击成功率,显著提升对抗现有防御的隐蔽性。该研究揭示了VLM在推理层面存在的安全脆弱性,对构建可信赖的多模态AI系统提出了新挑战。适合AI安全研究员、模型开发人员和防御团队阅读。

💡 推荐理由: 该攻击揭示了VLM推理层面的脆弱性,现有防御难以检测此类隐蔽后门,威胁到安全关键场景中VLM的可信性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Junran Wang, Xinjie Shen, Zehao Jin, Pan Li

随着视觉-语言模型(VLM)被越来越多地部署为具身助手的自主认知核心,评估其在物理环境中的隐私意识变得至关重要。与数字聊天机器人不同,这些智能体在家庭、医院等私密空间运行,能够观察并操作包含隐私敏感信息与物品的物理实体。然而,现有基准仍局限于单模态、基于文本的表达,无法捕捉真实世界的复杂性。为弥补这一空白,本文提出了 ImmersedPrivacy,一种交互式视听评估框架,基于 Unity 模拟器构建逼真的物理环境。ImmersedPrivacy 通过三个递进层级测试模型的物理隐私意识:第一层级评估在杂乱场景中识别敏感物品的能力;第二层级测试适应社会语境变化(如陌生人进入房间)的能力;第三层级考察解决显式命令与隐含隐私约束之间冲突的能力。作者对 12 个当前最先进的 VLM 进行了评估,发现了一致的缺陷。在杂乱场景中,所有模型的性能随场景复杂度增加而单调下降,表明存在感知缺陷。当社会情境改变时,没有模型的选择准确率超过 65%。在冲突命令下,表现最好的模型 gemini-3.1-pro 也仅在 51% 的案例中完美平衡了任务完成与隐私保护。这些发现揭示了当前 VLM 在物理世界中存在感知脆弱性,并且无法让隐私知识主导其情境化行为。代码和数据已开源。

💡 推荐理由: 该研究首次系统评估了 VLM 在物理世界中的隐私意识,揭示了当前模型在杂乱场景、社会情境变化及命令冲突下的严重缺陷,对部署具身 AI 在家庭、医疗等私密空间的安全风险具有重要警示意义。

🎯 建议动作: 研究跟进,建议安全团队关注 VLM 在物理环境中的隐私风险,将其纳入内部评估流程。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)