#multimodal

共收录 27 条相关安全情报。

← 返回所有主题
👥 作者: Junbin Lu, Hsiang-Wei Huang, Saesha Wadhwa, Yu Ting Hsu, Jenq-Neng Hwang

该论文提出 SpatialTrust,一个面向安全认证场景中环境风险识别能力评估的多模态大语言模型(MLLM)问答基准。研究背景是:在安全认证过程中,用户周围环境可能泄露敏感信息或引入潜在安全风险(如屏幕内容被旁观者看到、摄像头拍到隐私区域等),因此视觉环境风险识别至关重要。然而现有 MLLM 评估很少检验模型能否在空间定位的认证场景中可靠地识别、定位并解释这类风险。SpatialTrust 从五个互补能力维度进行评估:敏感因素检测、直接因素识别、间接因素识别、直接因素解释、间接因素解释。作者对专有和开源 MLLM 进行了系统评测,发现当前模型整体表现有限,尤其在理解和解释间接风险方面存在显著短板,说明空间风险感知对 MLLM 而言仍是一项具有挑战性的能力。此外,论文提出 SpatialTrustGuard,一种结构化的 QA(问答)与审计流水线,通过分步推理和审计机制增强模型的输出可靠性;在 Qwen3-VL-30B-A3B-Instruct 上将总体准确率从 36.78% 提升至 41.12%。研究结论强调,需要专门的基准测试和结构化推理方法来提高 MLLM 在安全认证场景中的可信度。该工作适合关注多模态模型安全评测、认证环境风险分析以及 AI 可解释性的研究人员和安全工程师阅读。

💡 推荐理由: 该基准填补了 MLLM 在安全认证环境风险识别方面的评估空白,帮助安全团队理解大模型在物理世界风险感知上的局限,避免在真实认证场景中过度信任模型输出。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xueying Zeng, Youquan Xian, Yanze Li, bowen hu, Ziqi Shan, Xu Luo, DanPing Yang, Peng Liu, Lei Cui, Bo Li

本文提出了一种名为 Moirae 的多模态智能体协作框架,用于动态 Android 恶意软件检测。针对现有机器学习检测器容易受到概念漂移影响的问题(因为依赖随时间变化的实现特定特征),以及当前基于大语言模型(LLM)的检测器通常仅依赖代码或单维度证据、易受混淆和难以全面分析行为的问题,Moirae 通过动态收集多模态运行时证据,并采用基于 ReAct 的专门智能体来分析视觉、UI 状态转换及运行时 API 行为等互补视图。检测流程首先识别视觉欺骗线索,然后建模 UI 状态转换,最后集成运行时 API 行为,从而融合用户可见界面和隐藏后端操作的多维度证据。在时间和分布上不可见的数据集上,Moirae 无需微调即可达到 90.06% 的准确率,优于现有基线,并展现出卓越的零样本泛化能力,能够有效抵御 Android 恶意软件概念漂移。该研究为结合多模态行为分析和智能体协作的移动安全检测提供了新思路。

💡 推荐理由: 该框架通过多模态智能体协作,显著提升了对混淆和概念漂移的抵抗能力,为动态恶意软件检测提供了可借鉴的零样本泛化思路,对移动安全运营具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shiva Shrestha, Zongxing Xie, Chen Zhao, Liran Ma, Zhipeng Cai, Honghui Xu

该论文关注医疗AI中多模态数据(图像+文本)的去标识化(de-identification)问题。随着医疗视觉语言模型的发展,图像中可能包含可见的受保护健康信息(PHI),如患者姓名、病历号等,而文本侧也可能泄露隐私。现有方法往往将去标识化与下游任务性能分开评估,缺乏端到端的隐私保护框架。作者提出ClinX,一个面向医疗图像-文本数据的多模态PHI清洗框架。ClinX首先使用光学字符识别(OCR)检测图像中的可见标识符,构建二进制PHI掩码,然后应用ClinX-PRISM模块——一种无跳跃连接(no-skip)的生成式修复模块,结合面向隐私的后处理来抑制烧录的标识符。同时,文本侧通过渐进式去标识化层级减少PHI泄露:包括正则表达式掩码、上下文感知掩码和重写式清洗。作者在医学视觉问答(MedVQA)任务上评估ClinX,联合测量图像侧、文本侧及组合去标识化设置下的PHI泄露和下游效用。实验结果表明,仅使用OCR掩码不足以作为独立解决方案,而基于生成式修复的清洗方法能更好地保留临床相关视觉上下文,同时大幅降低可恢复的PHI。该研究为医疗AI隐私保护提供了新的端到端思路,适合医疗AI开发者、隐私保护研究者和多模态安全从业者阅读。

💡 推荐理由: 医疗多模态数据在训练与推理中面临PHI泄露双重风险,现有掩码方法不足,ClinX提出的生成式修复与渐进式文本清洗为蓝队提供了可借鉴的隐私防护思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Samuel Howard, Kshitiz Aryal, Mahmoud Abdelsalam, Maanak Gupta, Andrew Wheeler, Pradip Kunwar

传统的恶意软件检测系统通常依赖单一的样本表示(即模态),难以有效识别新型威胁,且某些模态提取过程依赖反汇编成功率,导致模型在多变样本上的判别能力不足。已有工作尝试融合多种模态或增强表示,但多为双模态或改进单个表示。为此,本文提出 Malformer,一个四模态 Windows 可执行文件恶意软件检测模型,融合了文本(原始字节/符号等)、图像(二进制可视化)、图(控制流等)和音频(指令音频化)四种表示。模型架构采用两个 RoBERTa 编码器处理文本类模态,一个修改后的 Vision Transformer 处理图像数据,WavLM 处理音频数据,并通过自适应损失加权机制有效融合各模态的特征表示,避免手工调参。在包含 201,549 个二进制样本的数据集上评估,Malformer 实现了 98.3% 的准确率和 0.9833 的 F1 分数,相比单模态基线和双模态检测器分别提升了 4.6 至 17.6 个百分点。实验表明,多模态融合能够显著增强 Windows 恶意软件检测的泛化能力和鲁棒性,为应对日益增长的恶意软件规模提供了有前景的检测框架。该工作适用于安全研究人员、检测工程人员及对机器学习与恶意软件分析交叉领域感兴趣的读者。

💡 推荐理由: 多模态融合提高了恶意软件检测的准确性和鲁棒性,减少对单一模态提取(如反汇编)的依赖,有助于检测新型或变种恶意软件,值得蓝队与安全工具开发者关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md Abdullahil Oaphy, Anhao Xiang, Zongxing Xie, Huayue Gu, Chenyu Wang, Honghui Xu

本文针对多模态大语言模型(MLLM)在视觉输入场景下的新型安全风险展开研究。作者指出,在许多多模态越狱攻击中,单独的文本提示或图像本身并无危害,但当模型将一个看似无害的操作(如摘要、翻译、指令跟随)绑定到一个具体视觉目标时,不安全行为便会产生。这种“引用依赖”的失败模式暴露了现有防御机制的结构性弱点:当前防御大多将提示-图像对作为一个整体进行审核,而真正需要关注的安全单元是模型在解引用(dereference)过程中形成的“操作-目标”对。基于此,作者提出了一种名为COMIC的引用感知预生成安全门控机制。COMIC首先推断请求的操作和引用类型,通过OCR和开放词汇目标建议构建候选目标,完成对可行指称对象的定位,然后对显式的“操作-目标”对进行安全性评估。为保守处理歧义,COMIC在决定放行或阻止请求之前,结合了最大风险聚合和质量感知路由。作者在多个开源MLLM、局部化及更广泛的多模态越狱基准测试以及良性引用敏感场景中评估了COMIC,结果表明该方法在保持良性效用和实际效率的同时,持续增强了模型的鲁棒性。该研究进一步表明,若不对请求操作、该操作所作用的视觉目标以及该指称定位的置信度进行建模,多模态安全将无法可靠地得到保障。

💡 推荐理由: 该研究揭示了多模态大模型安全防御的关键盲区:现有方法忽略“操作-目标”级引用关系,导致恶意语义可被分割到独立的提示与图像中而绕过审核。COMIC为构建引用感知的安全门控提供了新思路,对防范新兴多模态越狱攻击具有重要实践价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Beining Xu, Hairui Wang, Jiaxin Wang, Changsheng Chen, Anirban Chakraborty

本文关注多模态大语言模型(MLLM)在文档理解场景下的隐私泄露问题,尤其是面向身份证件等身份文档处理的领域专用MLLM。作者指出,现有研究多聚焦于通用MLLM的隐私风险,而领域专用模型在关键信息提取(KIE)任务中的独特脆弱性尚未被充分探索。当输入图像缺乏足够的视觉证据时,模型可能依赖训练数据中学到的字段关系来推断缺失内容,从而泄露多个相互关联的敏感字段(如姓名、证件号、地址等),形成关系型隐私泄露。为缓解这一风险,本文提出动态关系遗忘框架(DRUF),包含关系解耦遗忘模块(RDU)和动态集合更新机制,在不显著降低KIE性能的前提下抑制高风险字段对的泄露。同时,作者构建了DocPrivacyBench基准,用于系统评估模型在视觉证据缺失或极少情况下对隐私泄露的敏感性。基于该基准,研究评估了三种MLLM和六种遗忘方法,考察遗忘后的泄露抑制效果与工具实用性保持。实验结果表明,现有MLLM在视觉证据稀缺时普遍存在隐私泄露,且在噪声较大的数据集上更为严重;而DRUF相比最强基线将泄露抑制率提升4.8个百分点,有效缓解隐私风险并保持鲁棒的文档信息提取性能。本文为文档类MLLM的隐私保护提供了新的评估基准和有效的遗忘方法,适合从事多模态模型安全、隐私保护和文档智能处理的研究人员及安全工程师阅读。

💡 推荐理由: 文档MLLM处理身份证件等敏感信息,视觉证据不足时可能产生关系型隐私泄露。本文首个系统评估该风险并提出DRUF遗忘框架,为蓝队评估和防护此类模型提供了可用的基准与方法。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shenyi Zhang, Keyan Guo, Zihao Wang, Xuebin Li, Lingchen Zhao, Hongxin Hu, Chao Shen, Qian Wang

多模态大语言模型(MLLMs)在处理文本输入时往往能正确拒绝不安全内容,但对语义等价的多模态输入(如图像+文本)却可能生成有害响应。现有防御手段要么依赖外部护栏,增加推理开销且无法修复模型内在缺陷;要么采用安全微调,但这种黑盒优化可能牺牲模型效用或需要大量多模态数据集。本文旨在探究这种安全差异的根本原因,作者对 MLLM 的表示进行了几何分析,发现从文本中学习到的安全机制可以跨模态保持:模型中存在一个共享的安全子空间和拒绝边界,落入该边界的表示会触发拒绝。然而,不安全的多模态输入会发生表示偏移,使大部分样本落在该边界之外,从而绕过模型固有的安全机制。这表明多模态安全退化源于表示错位,而非安全能力的缺失。基于此发现,作者提出 MMAligner 防护方法,将不安全的多模态表示校准到预先存在的拒绝区域。MMAligner 采用硬下界确保拒绝,软上界避免过度修改,并加入针对良性输入的保留目标。在多个开源 MLLM 上的实验表明,MMAligner 能将不安全多模态输入的平均拒绝率提升至 99%,效用下降不到 2%,且所需训练数据极少,相比现有基线显著改善了安全性与效用的权衡。该研究为多模态大模型的安全对齐提供了新的几何解释与轻量级解决方案。

💡 推荐理由: 该研究揭示了多模态大模型安全失守的根因是表示错位而非能力缺失,为不依赖外部护栏的轻量级防御提供了新思路,对当前多模态应用的安全防护具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

该论文聚焦于多轮视觉故事生成中的仇恨意图评估与检测问题。作者指出,图文绘本和漫画长期被用于传播仇恨叙事,因为它们易于理解,连儿童也能看懂,例如纳粹宣传绘本《Der Giftpilz》。随着Gemini、GPT-Image等前沿文本到图像系统的出现,跨轮次生成具有一致角色和场景的对话式图像已成为可能,这使得仇恨视觉故事(即有序图像组共同传达仇恨叙事)的生产变得低成本且可规模化。尽管已有工作研究了T2I系统生成仇恨内容,但主要针对单张图像,忽略了图像组层面的仇恨含义。为填补这一空白,作者引入了HatefulStoryPrompts数据集,包含55个仇恨故事、330种多轮配置,覆盖两种语言和三种视觉风格,并对五个前沿模型进行了4950次测试。结果显示,所有模型都能完成超过80%的故事,最强模型完成率达99.0%。作者进一步评估现有审核系统在HatefulVisualStory数据集(包含969个仇恨图像集和990个良性对照)上的表现,发现现有系统经常漏检群组级仇恨含义:专用安全模型召回率最高仅34.9%,而强大的视觉语言模型也仅达67.5%。最后,作者提出了互补的主动式与生成后防御措施:交互感知监控器在仅提示会话中实现97.3%的召回率,在用户提供首图时达到92.6%;而生成后方法联合分析完整图像组可达80.2%的召回率。该工作表明,随着图像生成从孤立输出演变为连贯视觉叙事,安全机制必须相应进化,从逐图像审核转向对交互和图像关系的状态化推理。

💡 推荐理由: 揭示了多轮T2I系统可被用于规模化生成仇恨视觉故事,而现有审核机制在群组级语义检测上严重不足,为防御方提供了新的检测思路和基线。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yiming Chen, Kemou Li, Haiwei Wu, Jiantao Zhou

本文针对多模态对比学习(MCL)中的后门攻击检测问题展开研究。MCL 模型(如 CLIP)被广泛用于预训练,但其容易受到后门攻击的影响,现有基于检测的防御手段主要依赖 CLIPScore 指标,假设中毒图像-文本对具有较低的语义相似度。然而,作者指出现有方法存在两个关键缺陷:一是良性对与中毒对的 CLIPScore 分布存在显著重叠,使得该指标难以可靠区分;二是固定阈值检测无法对重叠区域中的模糊样本提供统计保证。为克服上述局限,本文引入保形预测(Conformal Prediction, CP)这一统计框架,利用非一致性分数(Nonconformity Scores, NCSs)量化不确定性,从而为检测中毒图像-文本对建立具有可证明置信界的方法。在此基础上,作者提出 CASCADE——一种新型的两阶段粗到细的保形后门检测框架。在粗粒度阶段,通过跨模态一致性筛选出高置信度的良性对和中毒对;在细粒度阶段,利用高置信度中毒对构建参考集,并针对未识别子集中的每个样本计算基于文本空间相似度的实例级 NCS,以度量其与中毒分布的符合程度,进而精确识别潜在中毒对。在 CC3M 大规模数据集上的大量实验表明,CASCADE 在多种攻击场景下平均可实现 100% 真阳性率(TPR)时仅 5.79% 的假阳性率(FPR),平均 AUROC 达到 0.9867,并且对自适应攻击仍保持有效性。该工作为多模态对比学习模型提供了一种兼具统计保证与高检测精度的后门防御新思路。

💡 推荐理由: 多模态预训练模型已被广泛采用,后门攻击威胁真实存在。现有 CLIPScore 检测法有统计缺陷,CASCADE 通过保形预测提供可证明的置信界,提升了检测可靠性,值得安全从业者关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shuo Shi, Rui Yin, Naen Xu, Jiahao Chen, Chunyi Zhou, Tianyu Du, Zhihui Fu, Jun Wang, Zhaoxiang Wang, Shouling Ji

该论文首次系统性地研究了多模态安全护栏模型(multimodal guard models)中的一种新型对抗威胁——“不安全诱导攻击”(Unsafe Induction Attacks)。与以往关注越狱攻击(产生假阴性,即放行恶意内容)不同,该攻击旨在诱导安全过滤器对良性输入产生假阳性,即错误地将安全图像判定为不安全内容,从而拒绝合法用户请求。作者将这种现象类比为“狼来了”效应,指出其会严重降低服务可用性并侵蚀用户信任,揭示了已部署安全过滤器的一种可用性故障模式。为了实现这一威胁,论文提出了一种名为“不安全语义蒸馏”(Unsafe Semantic Distillation, USD)的方法,该方法不针对具体提示词实例,而是将对抗扰动与不安全内容的分布式表征对齐,从而在多样化的用户提示下仍能高效触发误判。作者在四个最先进的安全护栏模型上进行了评估,并模拟了真实的用户交互场景。实验结果表明,USD 的攻击成功率高达 84%,显著优于现有方法,暴露了当前多模态安全架构中的根本性弱点。该研究为多模态内容安全评估提供了新视角,强调安全护栏不仅要防恶意绕过,也要防恶意误报,对防御者设计健壮的安全过滤机制具有重要参考价值。适合关注大模型安全、红队评估、可用性攻击及对抗机器学习的研究人员和工程师阅读。

💡 推荐理由: 该攻击颠覆了传统越狱方向的关注点,揭示安全护栏可能被利用来拒绝合法请求,造成服务拒绝和信任危机,是防御者必须正视的新型可用性风险。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mingxiao Liu, Yitong Li, Haoren Zhao, Yaoxiang Bian, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

本文研究多模态大语言模型智能体在连续音频交互场景下面临的新型安全威胁——并发音频提示注入攻击。随着以LLM驱动的多模态智能体通过语音与用户进行自然交互并自主执行任务,音频输入中不可避免地包含环境噪声,这为攻击者提供了可乘之机。与针对语音设备的传统声学攻击不同,作者提出了指令增强和场景隐藏两种新技术,使恶意音频指令能够不可感知地“搭便车”在用户语音之上,从而劫持智能体执行恶意操作。为系统量化该威胁,作者构建了首个音频指令注入攻击基准AudioAgentSecurity,涵盖8个真实任务场景和10种不同攻击模式,并评估了包括Gemini 3 Pro和GPT-4o-audio在内的11个先进智能体。实验表明,所提方法对Gemini 3 Pro的平均攻击成功率(ASR)达到69.10%。为防御此类攻击,作者进一步提出级联音频解耦与验证(CADV)机制,基于源分离和一致性分析,与现有提示级防御相比,检测准确率最高可达96%,能有效防御多种声学注入攻击。最后,在豆包AI智能手机上结合人类志愿者的真实世界实验,在多样动态场景中验证了攻击的高隐蔽性和有效性,同时证明CADV防御能够可靠缓解这些漏洞。该研究揭示了多模态音频交互中未被充分探索的攻击面,并为后续防御研究提供了基准和方法。

💡 推荐理由: 该研究揭示多模态LLM智能体的音频输入通道存在可被利用的注入攻击面,影响范围覆盖主流商用模型,为蓝队理解和防御此类新型音频提示注入提供了首个系统化基准和有效防御方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ameena Khan, Muhammad Ahsan Aziz, Muhammad Junaid Asif, Naeem Akhter, Rana Fayyaz Ahmad

本文提出了一种多模态深度伪造新闻检测框架,旨在通过同时分析视频中的音频和视觉线索来鉴别视频内容的真实性。该框架首先从唇部运动(使用LipNet编码)、音频内容(使用DeepSpeech2编码)和视频帧(通过BlazeFace检测人脸并用ResNet18提取视觉特征)中提取特征。然后将这些特征向量拼接成统一的视频表示,并使用集成分类器(随机森林RF、多层感知器MLP、长短期记忆网络LSTM)进行真伪判别。在FakeAVCeleb数据集上的实验表明,该方法在增强音频特征的情况下达到了94%的准确率,优于现有的多模态集成基线。研究证实了该框架在深度伪造新闻检测中的鲁棒性和实际应用潜力。

💡 推荐理由: 深度伪造新闻的泛滥严重威胁数字媒体真实性,该研究提出了一种有效的多模态检测框架,可助力安全从业者和平台方识别AI生成的虚假视频内容。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Halima Bouzidi, Mboutidem Ekemini Mkpong, Mohammad Abdullah Al Faruque

多模态AI代理越来越依赖持久性长期记忆来在视觉和文本上下文中进行生成。本文揭示了对视觉数据的无条件信任是一个关键安全漏洞。作者提出了Lucid,一个黑盒对抗性框架,在严格的图像受限威胁模型下攻击多模态记忆管道,无需访问目标多模态大模型(MLLM)、目标检索编码器或文本通道。Lucid通过构建人眼不可察觉的扰动,实现了两种不同的故障模式:1)记忆投毒(in-context攻击):用对抗图像替换被先前文本上下文强化内容的良性图像,可靠地破坏视觉回忆,将代理引导至攻击者选择的叙事;2)记忆注入(out-of-context攻击):在缺乏先前文本基础的对话轮次中替换良性图像,导致代理生成受攻击者影响的回应,且无来自记忆的纠正信号。实验在多种对话领域和五种黑盒记忆架构(包括图结构化、LLM总结型以及商业部署系统)上进行,Lucid在投毒攻击上达到61.6%的攻击成功率(ASR),在注入攻击上达到58.4%的ASR,暴露了多模态记忆管道中的结构性脆弱点。本研究适合AI安全研究员、多模态系统开发者及防御者阅读。

💡 推荐理由: 首次系统性地证明多模态AI代理长期记忆中的视觉通道可被黑盒操纵,导致代理输出被攻击者控制的内容。这对依赖视觉上下文的企业级AI助手的可信度构成实质性威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Baogang Song, Zhongshu Zhao, Qianrong Zheng, Jianwen Xiang, Dongdong Zhao

针对生物特征模板保护(BTP)中存在的可比较表示泄露、辅助数据依赖、与具体模态耦合等问题,本文提出了一种名为多置换标签分类器编码(MPLCE)的新方法。其核心思想是利用身份分类的固有特性——将变化的生物特征样本映射到稳定且具判别性的身份级输出。MPLCE 为每个分类器分配独立的标签置换,使得同一身份在不同分类器中被赋予不同标签;将这些预测标签编码并拼接形成中间模板,然后与特定应用的异或字符串随机化,最后进行密码学哈希。这一设计避免了单个身份标签的重复编码,扩大了有效候选空间,同时通过分类一致性保证准确率。由于采用加密哈希精确匹配验证,无需纠错码或依赖生物特征的辅助数据。MPLCE 支持多种模态,只需替换相应分类器即可。在四个面部数据集(如 YTF、CASIA-WebFace 等)和两个虹膜数据集(CASIA-Iris-Lamp 等)上,MPLCE 取得了具有竞争力的性能:在 YTF 上误识率(FAR)为 5.51×10⁻⁵% 时识别率(GAR)达 98.61%;在 CASIA-Iris-Lamp 上 FAR 为 0.00% 时 GAR 达 99.10%。安全性分析验证了在威胁模型下模板的不可逆性、可撤销性和不可链接性。该方法为生物特征模板保护提供了一种理论新颖且实践可行的方案,尤其适用于需要高安全等级的跨境认证、金融支付等场景。

💡 推荐理由: 提出了无需辅助数据、跨模态兼容的生物特征保护方案,通过哈希精确匹配避免了传统方法中的相似性结构泄露风险,对提升生物识别系统安全性有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Reshabh K. Sharma, Vinayak Gupta, Dan Grossman

本文聚焦于多模态大语言模型(MLLM)面临的基于图像的提示注入攻击防御问题。随着聊天机器人系统广泛支持图像与文本混合输入,攻击者可通过恶意构造的图像绕过文本层面的安全机制,而现有防御手段仅针对文本数据,对此类攻击几乎无效。为此,作者提出了一种新颖的两阶段防御框架:第一阶段为输入验证,在用户输入到达聊天机器人之前,利用用户提供的规范识别潜在不安全图像;第二阶段为提示注入检测,对已进入MLLM主干的图像进行深度分析,抵御恶意攻击。框架核心是一个面向安全聊天机器人定义的领域特定语言(DSL),允许用户制定图像输入的安全规格。在GPT-4VISION和LLAVA等模型上的实验表明,单纯依赖模型自身鲁棒性难以防御,而本方法能显著提升恶意攻击检测率,同时保持较低误报率。论文贡献在于:首次系统研究MLLM图像提示注入防御、提出可定制的两阶段方案、以及展示DSL在安全规范表达上的灵活性。适合关注多模态AI安全、提示注入防御以及人机交互可靠性的研究人员和工程师阅读。

💡 推荐理由: 针对多模态大模型图像提示注入这一新兴且防护薄弱的安全威胁,本文提出了首个系统化的定制防御框架,填补了现有方法仅处理文本的空白,对保障图像对话类AI应用的安全性具有重要参考价值。

🎯 建议动作: 研究跟进,评估该方法在自身环境中的适用性。

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Refat Ishrak Hemel, Ehsan Hallaji, Roozbeh Razavi-Far

该论文提出了TSAI-MetaFraud,一个面向元宇宙生态系统金融欺诈交易和行为风险检测的多模态、多任务基准数据集。随着元宇宙平台虚拟经济的发展,欺诈、机器人和非法金融行为等新挑战日益突出。现有数据集通常孤立地关注用户行为、身份验证或金融交易,限制了多模态欺诈检测方法的开发和可重复评估。为此,TSAI-MetaFraud整合了行为、交易和图结构信息,同时包含现实的欺诈和自动化机器人场景。论文定义了多个基准任务,包括交易欺诈检测、跨模态节点分类、时序链路预测和弱监督欺诈检测,并利用机器学习和图神经网络模型提供了基线评估。该数据集通过统一虚拟经济中行为活动、金融交互和关系结构的联合捕获,为推进多模态学习、图挖掘、欺诈分析和可信AI在元宇宙生态系统中的应用提供了基准。适合对元宇宙安全、金融欺诈检测、多模态学习感兴趣的研究人员阅读。

💡 推荐理由: 元宇宙经济欺诈问题日益严重,但缺乏统一的多模态基准数据集。本数据集填补了这一空白,能推动可重复研究,帮助安全社区开发更有效的欺诈检测方法。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sally Junsong Wang, Kexin Pei, Junfeng Yang

智能合约是区块链上执行各种商业活动的软件程序。近年研究发现了一类新的“机器不可审计”漏洞,它们源于源代码未能满足底层交易上下文。现有检测方法需要人工理解交易逻辑并手动推理不同上下文来源(即模态),例如代码和描述预期交易行为的自然语言。为了自动化检测这类漏洞,本文提出了SmartInv,一个准确且高效的智能合约不变量推断框架。核心洞见在于,智能合约的预期行为(通过不变量指定)依赖于跨模态信息的理解和推理,如源代码和自然语言。作者提出了一种新的基础模型微调和提示策略——Tier of Thought (ToT),用于在智能合约的多个模态间进行推理并生成不变量。SmartInv随后通过检查这些生成不变量的违反情况来定位潜在漏洞。实验评估基于过去2.5年(2021年1月1日至2023年5月31日)导致财务损失的真实世界智能合约漏洞,结果表明SmartInv能生成有效不变量,准确定位“机器不可审计”漏洞,共发现119个零日漏洞。从中采样了8个漏洞报告给相应开发者,其中6个被迅速修复,5个被确认为“高严重性”。该研究展示了利用多模态大模型自动推理智能合约安全性的可行性和有效性。

💡 推荐理由: 该研究提出了一种自动化检测智能合约中新型“机器不可审计”漏洞的方法,填补了现有工具依赖人工的空白,对提升区块链应用安全性具有实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yv Zhang, Hao Sun, Hao Fang, Kuofeng Gao, Fan Mo, Bin Chen, Shu-Tao Xia, Yaowei Wang

本文研究了多模态Web智能体(Web Agent)中外部记忆组件(External Memory)的安全漏洞。现代Web智能体通常依赖外部记忆来存储长期经验,通过检索历史记录实现长程推理。然而,这种架构引入了一个关键风险:恶意内容若被注入记忆,可能在后续交互中被持续召回并反复影响智能体行为。作者系统性地识别并研究了多模态记忆投毒(Multimodal Memory Poisoning)这一此前被忽视的攻击面,并提出了一个统一的黑盒攻击框架MemVenom。该框架针对图结构的外部记忆,利用文本-图像协同证据进行投毒。其设计包含两个阶段:第一阶段是触发器条件检索攻击(Trigger-conditioned Retrieval Attack),确保恶意记忆以高概率被召回;第二阶段是检索后诱导攻击(Post-retrieval Attack Induction),通过对抗性扰动和隐蔽OCR注入覆盖用户原始目标。与以往基于提示或纯文本记忆的攻击不同,MemVenom无需修改模型参数或重新优化恶意任务,即可实现持久、可复用且目标无关的攻击。在多种Web智能体框架和视觉语言模型上的实验表明,MemVenom在GPT-5系列Web智能体上达到最高99.15%的成功率,且对良性性能影响极小,并在不同架构和模型规模间具有良好的迁移性。

💡 推荐理由: 首次系统性地揭示了多模态Web智能体外部记忆组件中的投毒攻击面,对依赖记忆的AI系统安全具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Prateek Paudel, Nitin Jha, Abhishek Parakh

这篇论文研究了一种跨模态分割载荷的视听隐写术,并评估了其对抗单模态与多模态隐写分析的效果。隐写术的目标是将秘密信息隐藏在普通媒体中,以隐藏通信的存在而非内容。传统的单模态隐写将载荷嵌入到单一载体(例如图像、音频或视频)中,但存在容量限制和容易被检测的问题。作者提出将秘密信息分割后分别嵌入到视频的音频流和视频流中,从而降低每个载体的嵌入负担,旨在提高隐蔽性。实验条件下,作者创建了同步和异步嵌入两种场景的视听样本,并测试了单模态(仅音频或仅视频)检测器以及多模态检测器的检测性能。结果表明,单模态检测器的检测率接近随机猜测,表明分割载荷能够有效规避单模态分析。而多模态检测器在初步测试中表现更佳,但进一步分析发现这种提升主要来自于视频流中的信号,而非真正的音频-视频联合特征。因此,作者强调,多模态检测器的评估需谨慎,以确保其学习到了跨模态的相关性而不是单一模态的伪影。总体而言,该研究表明分割载荷策略能增强隐写的抗检测性,但多模态检测方法仍有改进空间。该论文适合信息安全领域的研究人员,尤其是关注隐写术和隐写分析的学者阅读。

💡 推荐理由: 该研究揭示了分割载荷隐写术对抗检测的有效性,并指出当前多模态检测器的局限性,对设计更健壮的隐写分析系统具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiang Yang, Feifei Li, Mi Zhang, Geng Hong, Xiaoyu You, Mi Wen, Min Yang

该论文聚焦于多模态扩散变换器(DiT)中图像生成的安全性问题。尽管DiT结合多模态注意力(MM-Attn)已成为图像生成的主流架构,但在图像到图像(I2I)编辑等任务中,防止生成有害内容仍是一大挑战。现有安全机制多针对文本到图像(T2I)合成或U-Net架构,难以有效应用于基于DiT的统一安全缓解。为此,作者提出无需训练的安全生成框架——统一视觉安全调节器(UVR),通过限制不安全信息流来调控生成图像中的不安全语义。UVR基于对MM-Attn中信息流视角的注意力动态分析,发现一个与任务无关的启动阶段,在该阶段输出补丁中的不安全语义快速涌现并可被精确定位;随后进入任务特定的语义放大和干扰阶段,有害信号进一步传播并与良性内容纠缠。基于此观察,UVR通过对识别的不安全输出补丁实施统一的、目标性的注意力调制,并明确限制有害信息流,从而缓解不安全生成。实验涵盖多种概念,结果显示UVR在图像合成和编辑任务中分别达到91%和77%的擦除率,同时最小化视觉质量损失。代码已开源。该工作适用于图像生成安全、多模态模型对齐等方向的研究者。

💡 推荐理由: 提出了一种无需微调即可统一应用于图像生成与编辑任务的安全方法,基于注意力机制的信息流分析,为多模态扩散模型的安全对齐提供了新范式。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuan Tian, Bing Hu, Fang Wu, Xiaomin Li, Binghang Lu, Neil Zhenqiang Gong

本文研究了大型视觉语言模型(LVLM)中新兴的“伴随图像思考”(think-with-image)推理范式的安全性,特别是其对多模态越狱(jailbreak)鲁棒性的影响。现有系统已包含多种流程设计,如直接响应生成、纯文本前置回合、视觉状态操作以及显式外部图像工具调用。作者通过实验评估了这些范式在多模态越狱攻击下的鲁棒性,发现显式图像工具交互范式能够显著降低攻击成功率,在多个模型上平均相对降低约30%。这一发现最初令人惊讶,因为即使返回的图像工具输出被手动覆盖或本身看起来不安全,攻击成功率仍然较低,但在纯文本前置回合控制下会恢复到接近直接回答的水平。这表明低攻击成功率并非由返回图像的良性语义或文本图像工具痕迹单独解释。为了解释这一现象,作者引入了图像工具安全向量框架,将图像工具调用建模为隐藏表示向安全相关方向的残差偏移。基于表示层面的分析和激活干预实验支持了这一解释。总体而言,该研究表明显式图像工具交互是提高越狱鲁棒性的一种有前景的设计模式,同时促使对流程特定安全评估的需求。本文适合关注大模型安全、多模态AI系统风险及防御策略的研究者和安全工程师阅读。

💡 推荐理由: 多模态大模型正广泛部署,但其推理流程中的安全隐患尚不明晰。本文系统揭示了“显式图像工具调用”能显著提升越狱鲁棒性,为设计更安全的多模态系统提供了可操作方向,值得安全从业者关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tobias Braun, Jonas Henry Grebe, Hossein Shakibania, Anna Rohrbach, Marcus Rohrbach

本文首次研究了统一自回归模型(UAM)中的后门攻击漏洞。UAM是一种Transformer模型,能够在单个自回归过程中同时生成文本和图像token。其共享参数和多模态词汇简化了训练流程并支持灵活的多模态生成,但也引入了新的安全风险。作者提出了Token by Token后门攻击(ToBAC),这是首个针对UAM的后门攻击方法,涵盖基于数据和基于模型的投毒策略。攻击者可以将看似无害的字符或常见单词作为触发器,在图像生成过程中引发恶意行为,同时操纵视觉输出和伴随文本,从而提高虚假内容的可信度。在模型可访问的场景下,攻击者可以对统一Liquid模型进行攻击,使得一个微妙单词(如“cool”)在55%的生成中诱发与模态一致的品牌推广或意识形态影响。在无模型访问时,通过数据投毒即可实现攻击,对JanusPro的平均成功率达63.1%。实验表明,UAM的跨模态参数共享使得后门触发器能够跨模态传播恶意效果,这是一种新型安全威胁。本文的贡献在于揭示UAM特有的安全隐患,并展示了多模态后门攻击的可行性和有效性。

💡 推荐理由: 统一自回归模型是未来多模态AI的重要方向,本文揭示了其特有的后门攻击风险,攻击者可同时篡改文本和图像输出,对内容安全构成严重威胁。

🎯 建议动作: 跟进该研究,评估自身使用的UAM模型是否存在类似后门风险;关注后续防御技术发展。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.6
Conf: 50%
👥 作者: Guijia Zhang, Hao Zheng, Harry Yang

该论文提出了一种新型安全威胁:多模态智能体中的“幻觉即利用”(Hallucination as Exploit)。多模态智能体通过截图、文档、网页等视觉输入选择工具调用。当模型产生错误的视觉主张(如误认页面元素)并触发点击、邮件发送、数据提取或转账等操作时,幻觉从回答质量错误转变为授权失败。作者将此模式形式化为“幻觉到动作转换”(Hallucination-to-Action Conversion, HACR),即一个无依据的感知主张提供了特权动作看似被允许的前提条件。为防御此类攻击,论文提出了“证据携带多模态智能体”(Evidence-Carrying Multimodal Agents, ECA)。ECA 将模型自由文本视为不可采纳的证据,每个工具调用被分解为动作关键谓词,通过受限的 DOM/OCR/AX 验证器获取类型化证书,并由确定性门控仅授予证书所支持的权限。该架构不隐藏感知错误,而是将不透明的模型信念转换为命名的验证器、模式和实现残差。在超过1900次攻击的验证器红队测试中,通过四个针对性强化步骤将门绕过率从15%降至1.3%。使用内容派生证书,ECA 在200任务的端到端流水线中实现了0%不安全动作率(Wilson 95%置信区间上限2.67%),在120任务的浏览器概念验证中上限为4.3%。对500个分层任务键的HACR审计显示,无防御的智能体中不安全执行率达100.0%,仅提示防御为49.6%,而ECA为0%。Oracle证书回放在7,488个GPT-5.4基准轨迹上作为门正确性验证,神经评判基线在相同威胁模型下仍可被绕过。核心原则:模型语言可以提议动作,但外部证据必须授权它们。

💡 推荐理由: 首次系统化定义了多模态智能体中幻觉引发的安全漏洞,并提出了可落地的防御架构,对构建可信AI代理具有里程碑意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Doohee You

本文针对多模态大语言模型(MLLMs)在自主智能体工作流中面临的新型多轮多模态攻击的安全问题。传统静态防御机制受限于马尔可夫性质,逐轮独立评估输入,无法检测跨对话轨迹的累积恶意注入。为此,作者将安全验证形式化为动态生存预测与轨迹动力学问题,提出三阶异常防御(TRIAD)框架。该框架将多模态多轮对话流建模为连续轨迹,集成三大模块:结构异常检测监控协方差偏移、利用Ledoit-Wolf正则化马氏距离在高维空间检测偏移、以及拓扑轨迹加速度区分良性创造性探索与持续恶意漂移。这些运动学与几何特征通过贝叶斯隐马尔可夫模型(HMM)反馈循环输入时变Cox比例风险模型。理论分析表明,TRIAD框架能在对抗扰动下提供数学上有界的预期故障时间,确保恶意加速度正向发散。该框架为实时智能体AI系统提供了计算高效、可解释且可预测的安全保障,建立了无需经验重训练的持续安全对齐的严谨基础。

💡 推荐理由: 本论文提出了针对多轮多模态攻击的预测性防御框架,解决了现有静态防御在跨轮次累积攻击下的盲区,对智能体安全对齐具有重要理论价值和实际参考意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu

该论文针对大视觉语言模型(LVLM)在多模态网页数据上遭受的未授权爬取和训练问题,提出了一种名为MMGuard的主动防御方法。现有对策如机器遗忘和水印均属于事后处理,无法在知识产权侵犯发生前进行保护。MMGuard通过生成难以学习的样本(unlearnable examples),向多模态数据注入人眼不可察觉的扰动。该扰动利用LVLM的学习动态,最小化训练损失,从而创建优化捷径,使模型在训练时过度拟合噪声,而在推理时因扰动消失导致下游任务性能严重下降。为加强防御,MMGuard进一步引入跨模态绑定破坏机制,策略性地转移LVLM的注意力,强制噪声与训练目标之间产生虚假相关性,并从理论上证明了其有效性。此外,采用集成学习策略增强跨模型迁移能力,使扰动在不同LVLM架构间具有通用性。在9个开源LVLM和6个数据集上的实验表明,MMGuard在白盒、灰盒和黑盒威胁模型下均能提供有效、隐蔽且鲁棒的防护,证明其在主动防御未授权微调方面具有机制性优势。该研究适合关注数据版权保护、对抗性机器学习和多模态模型安全的研究人员与从业者阅读。

💡 推荐理由: 数据所有者面临多模态数据被未授权微调的严重风险,MMGuard提供了首个主动防御方案,可在侵权发生前阻止模型从数据中学习,对版权保护和隐私维护具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ishpuneet Singh, Gursmeep Kaur, Uday Pratap Singh Atwal, Guramrit Singh, Gurjot Singh, Maninder Singh

本文介绍了 BEACON(Behavioral Engine for Authentication & Continuous Monitoring),一个大规模多模态数据集,旨在支持高保真游戏环境下的行为生物特征认证研究。背景方面,现有连续认证基准受限于小规模、单模态或缺乏同步环境上下文,难以反映真实认知与运动需求。为解决此问题,作者从战术射击游戏《Valorant》中采集数据,该游戏要求高精度运动技能和高认知负荷,为行为生物特征的鲁棒性提供了严格测试。数据集包含从 28 名玩家的 79 场游戏中收集的约 430 GB 同步模态数据(磁盘总大小 461 GB,含辅助配置),估计活跃游戏时长 102.51 小时。模态包括:高频鼠标动态(移动、点击、轨迹)、键盘事件(按键时序与组合)、网络数据包捕获(流量模式与延迟)、屏幕录像(视觉上下文)、硬件元数据(帧率、输入设备)及游戏内配置(灵敏度、键位设置)。所有模态在时间上精确同步。BEACON 可用于连续身份验证、行为画像、用户漂移检测及多模态表示学习等研究。作者在 Hugging Face 和 GitHub 上公开了数据集与代码,旨在建立可复现的基准以评估下一代行为指纹与安全模型。适合安全研究人员、行为生物特征学者、游戏数据科学家阅读。

💡 推荐理由: 该数据集提供了高精度、多模态的游戏行为数据,可模拟真实高压场景下的用户行为,有助于开发更鲁棒的连续认证方案,减少传统静态认证的局限性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kyzyl Monteiro, Sauvik Das

访问控制是用户安全领域长期存在的挑战,核心难题在于如何让非专业用户轻松、准确地表达资源访问策略。本文提出了一种基于草图的多模态访问控制授权系统(Sketch-based Access Control, SBAC),将手绘草图的直观表达能力与多模态大语言模型(MLLM)的语义理解能力相结合,支持用户通过迭代细化的方式完成策略定义、分析与测试。作者通过一项包含14名参与者的形成性研究,提炼出三项设计需求:①允许用户以自然、非结构化的方式表达初始偏好;②提供可解释的中间反馈以帮助用户发现遗漏或不一致;③支持通过具体场景验证策略行为。基于这些需求,SBAC构建了人机协作三阶段工作流:Specify(指定)阶段,用户用草图、文字或语音混合描述策略意图,MLLM将其解析为结构化的访问控制规则;Analyze(分析)阶段,系统自动检测规则中的冲突、冗余或空窗,并通过对话引导用户澄清歧义;Test(测试)阶段,用户可输入模拟请求,系统展示策略判定结果,帮助验证是否符合预期。在另一次14名用户参与的评估中,参与者使用自身真实的访问控制场景(如家庭文件共享、团队文档权限)对系统进行测试。结果表明,SBAC帮助用户将最初模糊、不完整的偏好逐步转化为更完备、精确的策略——意外暴露了用户未预料到的权限缺口,通过自然语言对话解决了歧义,并通过具体案例验证了策略行为。该研究的核心贡献在于:①首次将草图界面引入访问控制领域,降低了策略编写的认知门槛;②提出了一种人机协同的策略精细化方法论,使非专家也能设计出意图一致的策略;③展示了多模态大模型在安全策略管理中作为“翻译器”的潜力。本文适合安全人机交互、策略管理及大语言模型应用方向的研究者和从业者阅读,尤其对构建更易用的访问控制工具具有启发意义。

💡 推荐理由: 访问控制的易用性与准确性长期矛盾,SBAC通过草图+多模态LLM的创新组合,为非专业用户提供了低门槛、高表达的策略编写方式,有望改善家庭、中小组织等场景下的权限管理实践。

🎯 建议动作: 研究跟进,关注后续可能提供的原型系统或用户研究数据,评估其在真实企业环境中的应用潜力。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)