该论文研究医疗影像诊断模型中的后门(训练期投毒)检测问题。作者指出,医疗行业指南已把模型投毒与对抗攻击列为需要专门防御的行业级威胁,联邦政策也要求把 AI 漏洞检测工具扩展到农村医院等关键基础设施运营方,因此面向医疗影像流水线的后门检测具有明确的合规与安全背景。目前社区中最常用的两类后门检测方法——频谱特征分析(spectral signature,基于类内表征的频域异常排序)与激活聚类(activation clustering,基于中毒样本在中间层激活空间中的聚类离群性)——通常被当作相互独立的基线分别评估,两者输出很少被结合;同时,在医学影像基准上的检测性能报告也远少于自然图像领域。本文的贡献有三点:第一,提出一个分数级融合规则,把逐类别的频谱排序得分与激活聚类标志位合成为单一逐样本投毒评分,并给出模型级一致性统计量;第二,开源实现该融合方案对应的八阶段检测流水线;第三,在一个公开医学影像基准的合成投毒变体以及 CIFAR-10 上,以 0%、1%、5%、10% 四档投毒率、每档五个随机种子进行评测,对比单独检测器与融合检测器的表现。结果显示:在医学影像基准上,融合检测器在所有非零投毒率下均达到 AUROC ≥ 0.99,说明融合在医疗影像场景下显著有效;但在 CIFAR-10 上融合并不一致地带来增益——10% 投毒率时激活聚类的真阳性率降至 0.000,频谱方法的 AUROC 也退化到接近随机(0.545),而此时攻击成功率仍高达 97.2%,表明后门已完全植入却未被检出,融合分数由于是两类信号的加权组合,也继承了这一联合失效。论文最后把检测输出映射到 NIST AI RMF 的 Measure 功能与 MITRE ATLAS 术语体系,使结论可以直接用安全与合规团队熟悉的语言表达。
💡 推荐理由: 医疗影像 AI 的后门检测长期缺乏公开基准与可复现工具。本文既给出开源八阶段流水线与融合评分方法,又诚实地暴露了方法在自然图像高投毒率下的联合失效(AUROC 退化至 0.545、攻击成功率 97.2%),对评估自身检测能力边界很有参考价值。
🎯 建议动作: 研究跟进