#Model Supply Chain

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Maria Rosaria Briglia, Igor Maljkovic, Antonio Emanuele Cinà, Luca Oneto, Iacopo Masi, Fabio Roli

该论文针对视觉-语言模型(VLM)供应链中的安全信任边界问题,提出了一类新型架构后门攻击。在VLM的典型供应链中,预训练权重、架构定义、文本编码器以及导出计算图往往由第三方提供并在下游服务中复用,导致部署方不仅继承模型参数,还会继承打包在共享模型工件中的可执行行为。作者证明,恶意模型提供者可以通过“表示转向”(representation steering)机制,在模型架构中嵌入潜在的后门逻辑:通过一个触发器控制的加法性修改,对中间表示施加干预,而无需污染训练数据、控制下游微调过程或修改部署时的提示词。当触发器不存在时,该修改为零,模型保持原有计算流程和干净输入上的正常效用;当触发器存在时,转向方向会将内部表示推向攻击者预设的目标。论文在多个VLM家族和下游任务上评估了该攻击,涵盖视觉问答、文生图、检索和语义响应偏向等,结果显示这种架构级转向后门能够破坏完整性、安全强制和排序公平性,同时不损害干净输入的模型行为。此外,论文还证明共享VLM工件可以携带针对下游服务的潜在转向逻辑。最后,作者提出了一种审计防御方法,重点检查随模型工件分发的可执行逻辑,而不仅仅是学习得到的权重。该研究揭示了VLM供应链中仅依赖权重验证的盲区,对构建安全的AI组件供应链具有重要参考意义。适合AI安全研究员、VLM部署方和模型供应链审计人员阅读。

💡 推荐理由: 该研究揭示VLM供应链中仅凭权重验证无法发现的新型后门攻击面,提醒蓝队和模型部署方必须审计整个模型工件中的可执行逻辑,而不仅仅是参数权重。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)