#foundation-models

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Jidong Yang, Qi Li, Wei Zong, Yang-Wai Chow, Willy Susilo, Huaike Yu, Chunpeng Wang, Suo Gao

该研究揭示了一种针对隐形水印的新型规避风险——水印清洗(watermark laundering)。传统上,隐形水印的鲁棒性测试仅针对压缩、模糊、噪声、裁剪、去噪等预定义扰动。然而,公开的基础图像模型(如 OpenAI 和 Google 的图像编辑模型)带来了一种截然不同的威胁:攻击者只需向模型提交一张带水印的图像并给出一个简单的重构提示(reconstruction prompt),模型便会返回视觉上高度保真的输出,但该输出中的隐形水印已无法被可靠解码。作者将这种失效模式形式化为水印清洗,并提出联合载荷-保真度评估框架,结合比特错误率(BER)与视觉/语义保持度进行量化。实验覆盖了六个 OpenAI 和 Google 图像编辑模型、三种代表性水印方案(含 DwtDct)以及 1,800 个重构输出。主要发现包括:OpenAI 模型在多数方案中产生最强的载荷破坏;Nano Banana 2 模型下 DwtDct 在高质量重构中仍显脆弱;消除提示(prompt ablation)表明,无需特定去除指令,单纯的重构路径即可导致水印失效,说明该效果主要来自重构机制而非攻击性措辞;与传统攻击(如加噪、压缩)相比,提示条件重构是一种独立的操作攻击界面。该研究为水印社区提出了新的要求:应将基础模型重构作为隐形水印鲁棒性评估中缺失的一项条件。适合水印技术研究者、AI安全工程师、内容溯源系统设计者阅读。

💡 推荐理由: 基础模型可被用作隐形的“水印清洗器”,只需一条简单提示即能绕过内容溯源机制,威胁版权保护和深度伪造溯源体系。安全团队需意识到传统鲁棒性测试已不足以覆盖现实攻击面。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Nobin Sarwar, Shubhashis Roy Dipta, Zheyuan Liu, Vaidehi Patil

随着视觉语言模型(VLM)、扩散模型(DM)、大语言模型(LLM)和音频基础模型(AFM)的广泛应用,这些多模态基础模型可能会从训练数据中无意编码敏感、受版权保护、有偏见或不安全的跨模态关联。在收到删除请求或政策更新后重新训练通常不切实际,而针对性的遗忘也很困难,因为知识分布在共享表示中。多模态遗忘通过选择性移除跨模态信息同时保持整体效用来解决这一挑战。本综述提供了一个统一的、系统导向的多模态遗忘视角,涵盖视觉、语言、音频和视频,基于近期进展、新兴应用和开放问题。提出的分类法能够在模型架构和模态之间进行系统比较,阐明删除强度、保留率、效率、可逆性和鲁棒性之间的权衡。综述强调了开放问题和实际考虑因素,以支持多模态遗忘的未来研究和部署。论文还发布了一个策划的资源库。

💡 推荐理由: 多模态遗忘对于确保AI系统符合隐私法规(如GDPR的删除权)和内容安全至关重要,安全从业者可利用此技术管理敏感数据泄露与版权风险。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Elias Lunderbye, Sourasekhar Banerjee, Christian Rohner, Andreas Johnsson

该论文探索了使用基础模型(Foundation Models)来检测和识别基于RPL的物联网(IoT)网络中的攻击。研究聚焦于多种攻击类型(包括黑洞攻击、DIS泛洪、最差父节点攻击和本地修复攻击),攻击变体以及网络配置,并评估了基础模型在攻击识别方面的性能。具体而言,作者对MOMENT基础模型进行微调,实现多类攻击识别。评估基于Cooja仿真环境生成的数据集,该数据集包含正常操作以及各类攻击下的RPL相关统计数据。初步结果表明,该方法在攻击检测性能上可与现有最先进方法相媲美,同时在区分不同攻击类型方面表现出色。该研究为基于RPL的IoT网络入侵检测提供了一种新的途径,利用基础模型的迁移学习能力减少了对大量标注数据的依赖。

💡 推荐理由: 该研究将基础模型引入IoT入侵检测领域,为RPL网络攻击检测提供了新思路,可能降低对大量标注数据的依赖,并提升对攻击类型的区分能力,对物联网安全防御有潜在价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)