推荐 9.5
Conf: 50%
本文是一篇关于对抗环境下可解释机器学习(Explainable Machine Learning)的系统化综述(SoK)。近年来,后验解释方法使得深度学习模型等'黑盒'决策过程可以实现精确的特征归因,这引发了利用这些方法来检测对抗样本或神经后门等攻击的期望。然而,现有的解释方法本身并不具备对抗鲁棒性,攻击者可能操纵解释结果。本文旨在系统地分类针对后验解释方法的攻击,为开发更稳健的可解释机器学习奠定基础。作者提出了一个解释感知的鲁棒性概念层次结构,并将现有防御措施映射到该层次结构中,从而揭示了防御措施之间的协同作用、研究空白以及未来方向。核心主张是:如果解释方法不能被攻击者误导,它们就可以成为对抗机器学习中的有效工具,标志着重要转折点。本工作面向机器学习安全领域的研究者,为其提供了系统化的视角,以理解可解释性的安全挑战。
💡 推荐理由: 对于依赖可解释性进行安全分析的工程师,此研究揭示了当前解释方法易受操纵的弱点。若将不鲁棒的解释方法用于检测对抗攻击,可能产生错误结论。了解这些攻击有助于选择更可靠的辅助工具。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)