该论文是一篇系统性综述 (SoK), 聚焦于一个长期被分散讨论的安全议题: 可解释人工智能 (XAI) 所输出的解释信息, 如何反过来成为攻击者窃取模型机密与训练数据隐私的入口。作者指出, 机器学习解释原本用于提升模型透明度, 但它揭示的是预测之外的模型内部行为, 因此天然扩大了对模型机密性 (model confidentiality) 与数据隐私 (data privacy) 的攻击面。论文系统梳理了 25 项利用解释信息实施模型窃取 (model extraction)、成员推断 (membership inference) 与模型反演 (model inversion) 的研究, 并将属性推断 (attribute inference) 视为模型反演的部分形式统一纳入分析框架。 论文的核心批评是: 现有工作往往只用黑盒 / 白盒二分法来标注威胁模型, 这种标签掩盖了关键差异 —— 攻击者究竟通过什么途径获得解释信号, 以及获得的是哪种解释信号。为此作者提出两层解耦: 把"对模型的先验知识"与"解释信息的获取方式"分开, 并归纳出五条解释获取路径: 目标方主动发布 (target-released)、攻击者自行推导 (attacker-derived)、二次披露 (secondary disclosure)、特权访问 (privileged access)、以及公开发布的全局产物 (released global artifacts)。 沿这五条路径, 论文给出了机制层面的结论: 解释可以显著降低模型抽取的成本; 通过解释统计量、追索距离 (recourse distance) 以及解释引导的鲁棒性信息, 会暴露成员信号; 解释还可支撑对私有输入的空間或代数重建。随后论文在多维度上对研究进行横向对比, 包括系统与威胁模型、解释信号类型、辅助知识、目标模型、数据模态、查询预算、评估指标、报告性能以及防御手段。 最重要的结论是: 不存在"一律不安全"的解释族, 也不存在"普遍有效"的防御。风险高低取决于四个变量 —— 暴露的是哪种信号、信号如何被获取、攻击目标是什么资产、以及攻击者已掌握哪些先验知识。作者因此主张把"解释隐私"当作端到端的信息披露问题来评估, 并让防御措施与具体的获取路径和被保护资产相匹配, 而不是笼统地禁用或信任某一类解释方法。该文适合 XAI 研究者、ML 隐私与模型安全工程师、以及需要评估第三方解释服务 (如解释 API) 风险的安全架构师阅读。
💡 推荐理由: 企业越来越多地对外提供模型解释或解释 API, 却普遍按黑盒/白盒简单划分风险。该文说明解释信号本身即可降低模型窃取成本、放大成员与属性推断, 并给出按获取路径匹配防御的评估框架, 可直接用于 ML 服务上线的隐私威胁建模。
🎯 建议动作: 研究跟进: 将五条解释获取路径纳入内部 ML 隐私威胁模型模板, 对自研解释服务做一次端到端披露评审