该论文提出了一个名为 SecurityNet 的框架,旨在系统性地评估公开机器学习模型的安全性弱点。随着预训练模型在开源社区(如 Hugging Face)广泛发布,攻击者可能利用这些模型中的后门、对抗性扰动等漏洞。SecurityNet 通过组合多种攻击方法(包括对抗性攻击、后门注入、模型窃取等),对公开模型进行自动化安全评估。实验覆盖了图像分类、自然语言处理等多种任务中的主流模型架构(如 ResNet、BERT)。主要贡献包括:1) 设计了一个模块化的评估管线,支持多种攻击场景;2) 在大量公开模型上进行了实证研究,揭示了相当比例的模型存在可利用的漏洞;3) 提供了可复现的基准,帮助研究者比较不同防御手段的效果。该工作为模型发布前的安全审查和模型供应链风险管控提供了参考工具。
💡 推荐理由: 帮助安全团队在引入第三方预训练模型前评估潜在风险,降低模型供应链攻击的可能性。
🎯 建议动作: 研究跟进