#model-evaluation

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Toshif Khan, Muhammad Abusaqer

该论文针对监督学习中的训练阶段数据投毒问题开展了一次系统的实证评测。研究背景是:数据投毒通过污染训练集来破坏模型整体性能,或向模型中植入由攻击者控制的后门行为,目前多数公开研究聚焦于单一攻击或单一模型,缺乏在统一实验条件下对不同投毒方式、不同投毒比例与不同分类器之间可比性的评估。为此,作者选取了两类具有代表性的训练时攻击——标签翻转(label flipping)与后门投毒(backdoor poisoning),并在 MNIST 与 Fashion-MNIST 两个图像分类数据集上进行对比实验。所用基线分类器包括逻辑回归(Logistic Regression)、线性支持向量机(Linear SVM)和随机森林(Random Forest),覆盖线性与非线性、参数化与非参数化模型,以便观察攻击效果对模型族的依赖。实验设计上,作者将干净训练(0% 投毒)与 5%、10%、20% 三档投毒率进行对照,评估指标不仅包括常规的干净测试集准确率,还引入宏平均精确率、宏平均召回率与宏平均 F1,用以捕捉类别层面的性能失衡;针对后门攻击,额外统计攻击成功率(Attack Success Rate, ASR),衡量攻击者指定目标行为的达成程度。主要发现分为两部分:其一,标签翻转会造成可观测的性能下降,且对逻辑回归与线性 SVM 的破坏最明显,随机森林相对更稳定,说明不同模型对标签噪声的鲁棒性存在显著差异;其二,后门投毒在两个数据集、三类模型上均取得 0.9667 至 1.0000 的攻击成功率,同时在多数情况下干净测试集性能仍接近基线水平。这一结果清晰地区分了“无差别投毒”与“定向后门投毒”:前者会在标准指标上暴露,后者则相对隐蔽,却能在特定触发条件下嵌入高度有效的恶意行为。论文由此论证,仅依赖干净测试集指标不足以评估模型的安全性,需要引入面向安全的评测流程,例如在训练数据审计、触发集检测与模型行为一致性检查等维度补充评估手段。该工作适合机器学习安全研究者、模型训练与数据治理工程师、以及负责 AI 供应链风险的安全团队阅读,可作为投毒风险基线评测与内部红队验证的参考。

💡 推荐理由: 论文用统一实验证明:后门投毒可在攻击成功率接近 100% 的同时保持干净测试性能几乎不变,常规测试指标几乎无法发现。这直接说明依赖准确率验收的模型上线流程存在盲区,安全团队需要将数据投毒纳入 AI 供应链威胁建模与评测基线。

🎯 建议动作: 研究跟进:将其实验设计(多投毒率、多模型、干净指标与 ASR 并行)纳入内部 AI 安全评测基线,并评估在自有数据管道中复现验证。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)