#encoder

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Jinyuan Jia 0001, Yupei Liu, Neil Zhenqiang Gong

本论文提出 BadEncoder,这是首个针对自监督学习(Self-Supervised Learning, SSL)的后门攻击方法。自监督学习在计算机视觉中通过大量无标注图像或(图像,文本)对预训练一个图像编码器,该编码器随后可作为特征提取器,搭配少量或无标注数据构建各类下游分类器。BadEncoder 的核心攻击思路是:向一个干净的预训练图像编码器中注入后门,使得基于该被污染编码器构建的所有下游分类器都能同时继承后门行为——即当输入样本包含特定触发模式时,分类器会被诱导输出攻击者预设的错误标签,而在正常输入上仍保持原有性能。作者将攻击形式化为一个优化问题,并提出基于梯度下降的求解方法,仅需有限样本和少量计算即可从干净编码器变换为后门编码器,且不要求访问下游任务的训练数据或模型。实验在多个标准数据集上验证,攻击成功率很高,同时下游分类器在良性输入上的准确率几乎不受影响。作者进一步在真实世界中测试了两种公开编码器:Google 在 ImageNet 上预训练的图像编码器,以及 OpenAI 在 4 亿互联网图文对上预训练的 CLIP 图像编码器,均证明 BadEncoder 有效。防御方面,论文评估了 Neural Cleanse、MNTD 等经验防御以及 PatchGuard 这种可验证防御,结果显示这些现有防御措施均不足以抵御 BadEncoder,突显了开发新型防御方法的迫切需要。该工作揭示了自监督学习供应链中的安全风险,对 AI 安全社区具有重要警示意义。代码已开源。

💡 推荐理由: 自监督预训练编码器被广泛复用为下游任务的基础,BadEncoder 利用该供应链特性实现一次投毒、多处生效,且现有防御失效,安全从业者需关注预训练模型的来源与完整性风险。

🎯 建议动作: 研究跟进:深入阅读原文并复现实验,评估自身所用预训练编码器是否可能受类似攻击,并探索针对性防御方案。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)