#xai

共收录 10 条相关安全情报。

← 返回所有主题
推荐 8.6
Conf: 50%
👥 作者: Abdullah Caglar Oksuz, Anisa Halimi, Erman Ayday

该论文是一篇系统性综述 (SoK), 聚焦于一个长期被分散讨论的安全议题: 可解释人工智能 (XAI) 所输出的解释信息, 如何反过来成为攻击者窃取模型机密与训练数据隐私的入口。作者指出, 机器学习解释原本用于提升模型透明度, 但它揭示的是预测之外的模型内部行为, 因此天然扩大了对模型机密性 (model confidentiality) 与数据隐私 (data privacy) 的攻击面。论文系统梳理了 25 项利用解释信息实施模型窃取 (model extraction)、成员推断 (membership inference) 与模型反演 (model inversion) 的研究, 并将属性推断 (attribute inference) 视为模型反演的部分形式统一纳入分析框架。 论文的核心批评是: 现有工作往往只用黑盒 / 白盒二分法来标注威胁模型, 这种标签掩盖了关键差异 —— 攻击者究竟通过什么途径获得解释信号, 以及获得的是哪种解释信号。为此作者提出两层解耦: 把"对模型的先验知识"与"解释信息的获取方式"分开, 并归纳出五条解释获取路径: 目标方主动发布 (target-released)、攻击者自行推导 (attacker-derived)、二次披露 (secondary disclosure)、特权访问 (privileged access)、以及公开发布的全局产物 (released global artifacts)。 沿这五条路径, 论文给出了机制层面的结论: 解释可以显著降低模型抽取的成本; 通过解释统计量、追索距离 (recourse distance) 以及解释引导的鲁棒性信息, 会暴露成员信号; 解释还可支撑对私有输入的空間或代数重建。随后论文在多维度上对研究进行横向对比, 包括系统与威胁模型、解释信号类型、辅助知识、目标模型、数据模态、查询预算、评估指标、报告性能以及防御手段。 最重要的结论是: 不存在"一律不安全"的解释族, 也不存在"普遍有效"的防御。风险高低取决于四个变量 —— 暴露的是哪种信号、信号如何被获取、攻击目标是什么资产、以及攻击者已掌握哪些先验知识。作者因此主张把"解释隐私"当作端到端的信息披露问题来评估, 并让防御措施与具体的获取路径和被保护资产相匹配, 而不是笼统地禁用或信任某一类解释方法。该文适合 XAI 研究者、ML 隐私与模型安全工程师、以及需要评估第三方解释服务 (如解释 API) 风险的安全架构师阅读。

💡 推荐理由: 企业越来越多地对外提供模型解释或解释 API, 却普遍按黑盒/白盒简单划分风险。该文说明解释信号本身即可降低模型窃取成本、放大成员与属性推断, 并给出按获取路径匹配防御的评估框架, 可直接用于 ML 服务上线的隐私威胁建模。

🎯 建议动作: 研究跟进: 将五条解释获取路径纳入内部 ML 隐私威胁模型模板, 对自研解释服务做一次端到端披露评审

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Amr S. Mohamed, Charlotte Fritz, Ahmad Mohammad Saber, Yiqun Ma, Ratinder Kaur, Mohammed Al-Darwbi, Daniela Friedrich, Deepa Kundur

本文是一篇关于可解释人工智能(XAI)在工业网络安全中应用的综述性论文。随着工业基础设施的日益数字化以及信息技术(IT)与运营技术(OT)的融合,工业系统的网络攻击面显著扩大。为应对日益复杂的网络威胁,人工智能(AI)和机器学习(ML)技术越来越多地被部署在工业网络安全运营中,尤其是在安全运营中心(SOC)内。这些方法虽能改进异常检测、威胁分析和自动化响应,但其决策过程的不透明性给运营信任、法规遵从和事件响应带来了挑战。可解释人工智能(XAI)作为提升AI驱动网络安全系统及决策透明度和可解释性的范式应运而生。本文聚焦于工业SOC环境和安全运营工作流程,对工业网络安全中的XAI技术进行了全面综述。文章首先审视了AI在工业SOC工作流程中的角色、工业环境中利用的运营数据类型,以及基于AI的威胁检测的优点和局限性;随后综述了主要XAI方法族,包括特征归因方法、代理模型、基于规则的说明和可视化技术,并分析了其在工业用例中的适用性;进一步讨论了将工业系统区别于传统IT环境的运营、法规和安全要求;深入剖析了关键挑战,如标记数据集有限、模型可靠性、可解释性与性能之间的权衡,以及将XAI工具集成到SOC工作流程中的难题。最后,作者指出了开放的研究方向,为开发可信赖、运营可行且面向特定领域的工业环境XAI网络安全解决方案提供了机遇。

💡 推荐理由: 工业SOC和OT安全人员可了解XAI如何增强AI威胁检测决策的可信度,辅助满足合规要求,并理解工业场景中集成XAI的独特挑战。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Muhammad Waleed Gul, Elaheh Homayounvala

金融欺诈检测系统通常依赖集中式机器学习模型,这带来严重的数据隐私风险。联邦学习(FL)通过将数据处理分散到各参与方来缓解这一问题,但金融监管仍要求模型具备可解释性,因此常使用TreeSHAP等可解释人工智能(XAI)工具。然而,近期网络安全研究表明,共享高保真度的SHAP解释会使联邦网络面临成员推断攻击(MIA)的威胁。本论文提出并评估了一种名为DP-FedSHAP的新型架构,该架构仅对后置的TreeSHAP向量施加客户端级别的差分隐私,并与直接扰动训练模型的权重级DP基线进行对比。研究使用高度不平衡的IEEE-CIS欺诈检测数据集,衡量了解释保真度、隐私保护水平与模型AUPRC(精确率-召回率曲线下面积)之间的权衡。论文的核心贡献在于:识别了联邦学习与可解释性结合时新出现的隐私泄漏通道,并针对该通道提出了一种轻量级、模块化的隐私保护方案,在保持模型性能和解释可用性的同时降低成员推断风险。适合关注金融风控、联邦学习、隐私保护机器学习及对抗性机器学习交叉领域的研究人员和工程师阅读。

💡 推荐理由: 该研究揭示了联邦学习+可解释AI组合中容易被忽视的隐私侧信道,对依赖SHAP类工具且需满足合规要求的金融风控系统有直接警示意义,为防御方理解并缓解成员推断风险提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Kavita Kumari, Alessandro Pegoraro, Hossein Fereidooni, Ahmad-Reza Sadeghi

本文提出了一种名为 Xplain 的模型解释性分析方法,旨在揭示模型解释中存在的“不可见相关性”(invisible correlations)。研究人员观察到,现有的可解释人工智能(XAI)方法通常只关注单一特征对预测结果的直接影响,而忽略了特征之间隐含的、非直观的相互作用,这些相互作用可能对模型的决策行为产生重要影响。为此,Xplain 设计了一种新的框架,能够从模型解释结果中自动挖掘并量化这些隐藏的关联模式,从而帮助安全分析师和模型审计人员更全面地理解模型行为。该方法的核心理念是将解释视为一种数据来源,利用统计关联分析和图结构来表征特征间的协同或抑制关系。作者通过实验证明了 Xplain 在多种模型和数据集上能够发现传统解释方法无法捕捉的关联,并展示了其在模型公平性、鲁棒性分析以及对抗样本检测(作为防御辅助手段)中的潜在用途。论文的主要贡献包括:其一,首次系统化定义了模型解释中的不可见相关性问题;其二,提出了一个无需修改原模型即可扩展的解释增强算法;其三,提供了可视化工具用以直观展示这些关联。本文面向的研究读者包括可解释人工智能、模型审计、以及安全防御领域的研究人员和工程师。需要注意的是,当前仅基于摘要进行分析,完整实验细节和代码尚未公开。

💡 推荐理由: 为蓝队和模型审计人员提供了一种新视角:不仅能解释单个预测,还能揭示特征间隐藏关联,帮助识别模型中的意外偏见或潜在后门行为,增强AI系统透明度。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Maraz Mia, Shovan Roy, Mir Mehedi A. Pritom, Maanak Gupta

随着机器学习模型在高风险场景中的广泛部署,可解释人工智能(XAI)方法(如SHAP和LIME)已成为满足监管合规和建立信任的关键工具。然而,当前的黑盒模型审计范式隐含地依赖一条“信任链”,即默认第三方审计人员是可信的。近期研究表明,这一假设存在缺陷:恶意的审计人员可以通过输出打乱(output shuffling)或构造分布外(OOD)数据等操纵攻击,在保持模型高预测准确率的同时隐藏模型偏见,从而生成“洗白”的解释(fairwashed explanation)。针对这一问题,本文提出了一种全新的防御框架ExplainGuard,它将零信任架构(ZTA)设计融入XAI解释供应链中,确保生成解释的完整性。该框架用持续的“先验证后信任”(verify-then-trust)方法取代了默认的“审计人员可信”这一模糊假设。其核心设计是建立一个策略决策点(PDP),在向用户发布任何解释之前强制执行三个不同的验证支柱:(1)资产完整性:通过行为指纹(behavioral fingerprint)检测模型替换;(2)语义有效性:利用公理化一致性检查拒绝数学上不可能的解释;(3)特征忠实性:采用排名稳定性方法进行验证,且计算开销极小。最后,作者评估了ExplainGuard如何有效中和最先进的解释操纵攻击,并将审计过程转变为可验证的操作。本文的主要贡献在于提出一个零信任的XAI审计框架,首次将零信任原则系统性地应用于解释完整性保障,并设计了三种互补的验证机制来抵御现有的操纵攻击。该研究适合关注AI安全、模型审计、可解释性以及零信任架构的安全研究人员和机器学习从业者阅读。

💡 推荐理由: 该研究颠覆了XAI审计中默认信任审计方的传统假设,提供了可落地的零信任验证框架,能有效防御解释操纵攻击,对依赖可解释性的合规审计和AI安全治理具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Vibha Bhavikatti, Mark Stamp

该研究专注于恶意软件检测领域中的二进制到图像转换技术,并引入可解释人工智能(XAI)工具来提升模型的可解释性。作者使用 Gradient-weighted Class Activation Maps (Grad-CAM) 作为解释工具,分析了由恶意软件样本生成的八种不同图像表示类型。研究目标包括:通过定量指标评估 Grad-CAM 热图的忠实度(faithfulness)和稳定性(stability),并将其与另一种解释方法 HiResCAM 进行对比;同时验证 Grad-CAM 特征能否用于恶意软件分类。实验表明,利用 MobileNetV2 卷积神经网络从 Grad-CAM 图像中提取特征,再使用随机森林分类器,可以在包含 17 个恶意软件家族的数据集上达到 0.777 的测试准确率,超过了该数据集之前 0.750 的基准结果。此外,研究还发现一个关键现象:在所选用的八种图像变换中,分类准确率与解释的忠实度并不一致,即能够产生最忠实解释的图像变换方法,其分类准确率仅处于中等水平。这一发现对恶意软件检测模型的设计与评估具有重要意义,提示在追求高准确率的同时需要兼顾可解释性。该工作为后续将 XAI 引入恶意软件分析提供了定量分析和实证基础。

💡 推荐理由: 该研究将可解释人工智能(Grad-CAM)系统应用于恶意软件图像检测,揭示了准确率与解释忠实度之间的矛盾,为蓝队在选择模型和特征表示时提供了新的评估维度,有助于提升安全检测的可信度。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Abdurrahman Tolay

本文针对物联网入侵检测中的机器学习模型,指出已有研究通常只强调预测精度,而将解释性分析(如SHAP)视为零计算成本的附加步骤,忽视了实际部署中的资源约束和解释成本。作者联合评估了预测性能、解释计算开销、局部解释稳定性以及选择性解释(即仅对关键样本生成解释)四个维度,并构建了一个避免数据泄漏的CICIoT2023数据集。数据处理上采用精确39特征哈希、非有限值处理、精确特征去重、保守的标签冲突移除和哈希级确定性划分,并基于自然分布与均衡分布两种测试集评估了逻辑回归、决策树、随机森林和梯度提升树(XGBoost)四类模型。实验显示,XGBoost整体预测能力最强,随机森林假阳性率最低。在5000个样本上计算TreeSHAP时,随机森林耗时700.759秒,而XGBoost仅需1.471秒,表明不同模型的解释成本差异悬殊。稳定性方面,随机森林的解释变化最小,XGBoost能保持较高排名和方向一致性,但top特征更替更频繁且属性幅度漂移更大。在均衡测试集上,利用约90%假阴性覆盖率的策略可节省28-32%的解释计算资源,95%覆盖率可节省15-23%;而在攻击密集的自然分布下,节省量大幅缩小。结果表明,实际可用的可解释物联网入侵检测系统应同时考虑预测质量、解释成本、局部稳定性、攻击样本预valence和选择性调用机制,而非仅依赖检测精度。该研究为资源受限环境下的可解释AI部署提供了量化评估基准。

💡 推荐理由: 为物联网入侵检测的可解释AI部署提供了成本与稳定性的量化洞察,打破了“解释免费”的假设,帮助安全团队在设计检测流程时合理分配计算资源,并理解模型解释在不同分布下的可靠性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sohan Gyawali, Yili Jiang, Jiaqi Huang 0001

该论文针对车联网通信网络中机器学习模型用于误行为检测时存在的“黑箱”问题,提出了一种将可解释人工智能(XAI)与大语言模型(LLM)相结合的新型框架,旨在提供透明、用户友好的解释,从而增强非专业用户(如网络运营商、监管人员)对系统预测结果的信任。具体而言,框架利用XAI(如SHAP)量化每个特征对检测结果的贡献,生成可视化解释;同时,通过引入上下文增强的LLM,将技术性的SHAP输出转化为易于理解的自然语言叙述。在真实车载网络数据集上的实验表明,该方法在保持高检测性能的同时,显著提升了可解释性。研究贡献在于首次将XAI与LLM协同应用于智能交通系统的误行为检测场景,兼顾了检测精度与用户信任需求。适合关注AI安全、可解释人工智能、智能交通系统、人机交互的研究人员和工程师阅读。

💡 推荐理由: 该研究解决了机器学习模型在关键基础设施(如车联网)中部署时因缺乏可解释性而导致用户信任不足的核心问题,为提升AI系统在安全敏感领域的实际采用率提供了可行路径。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Jose Luis Vela Alonso, Carmen Pellicer

该论文提出了一种面向数字取证场景的网络入侵检测框架,同时解决现有机器学习管线在证据保全和可解释性方面的缺陷。框架严格遵循ISO/IEC 27037、27041、27042及NIST SP 800-86等取证标准,将原始网络流量数据视为不可变、经过哈希验证的证据,所有模型训练均基于通过SDV+CTGAN生成的参数化合成数据,确保原始证据与衍生分析制品严格分离。检测器采用XGBoost二分类模型,在表格型网络流数据上实现高性能检测;可解释性模块利用SHAP TreeExplainer为每个实例生成特征归因,将统计预测映射为可观察的网络行为,用于生成法庭可采纳的取证报告。在CICIDS2017数据集上进行“合成训练、真实测试”(TSTR)评估,F1-macro达到0.96,与真实数据基线(0.97)的交叉验证方差相当。KS检验表明合成数据在隐私保护(平均|KS|=0.38)与操作效用之间取得平衡。跨数据集验证(UNSW-NB15、Kitsune)发现特征空间维度是合成训练效果的主要决定因素,确定了约30个数值流级特征的实际部署边界。针对暴力破解、端口扫描和DoS攻击的SHAP归因在真实与合成实例上保持一致,确认合成训练能够保留法庭专家证词所需的取证相关攻击指纹。本文适合数字取证、入侵检测和可解释AI领域的研究人员和从业者阅读。

💡 推荐理由: 该框架首次将取证标准(ISO/IEC 27037等)与机器学习管线深度整合,解决了传统AI方法无法满足法庭证据链要求的痛点,为网络入侵检测的可采用性和可解释性提供了可落地方案。

🎯 建议动作: 研究跟进,评估框架中合成数据生成与SHAP解释模块在自有取证流程中的可行性。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: B. M. Taslimul Haque, Md. Arifur Rahman, Md. Serajul Kabir Chowdhury Rubel, Md. Iqbal Hossan

该论文针对美国关键基础设施领域日益增长的网络安全威胁,提出了一种基于可解释人工智能(XAI)的网络风险分析与模型可靠性评估框架。研究背景指出,随着能源、医疗、交通、金融和通信等关键基础设施广泛采用智能数字技术,其暴露于高级网络攻击(如DDoS、僵尸网络、勒索软件和APT)的风险显著增加,传统安全机制难以应对动态演变的攻击环境。为此,研究者利用公开的CICIDS2017数据集,构建了基于机器学习的入侵检测和风险预测模型。比较了XGBoost、随机森林(Random Forest)和决策树(Decision Tree)等分类器在恶意流量检测上的性能,并重点集成SHAP等XAI技术,以增强模型决策过程的透明度和可解释性。评估指标包括准确率、精确率、召回率、F1分数、ROC-AUC和误报率,旨在验证模型的可靠性和鲁棒性。该框架最终目标是为美国关键基础设施的智能治理提供决策支持,提升网络安全风险管理的可信度与自动化水平。

💡 推荐理由: 该研究将可解释AI与入侵检测结合,有助于安全团队理解模型为何判定某流量为恶意,提升对AI驱动的安全系统的信任,特别适合关键基础设施等高风险场景的治理需求。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)