#interpretability

共收录 8 条相关安全情报。

← 返回所有主题
👥 作者: Yizhe Zeng, Chenxu Niu, Wei Zhang, Hao Huang, Yunpeng Li, Dongxu Han, Dan Du, Cheng Hong, Hequn Xian, Yuling Liu

该论文针对大语言模型(LLM)后门防御碎片化的问题,首次利用稀疏自编码器(SAEs)从特征层面进行系统的机制性分析,以解释为何现有防御方法难以统一应对不同标记类型的后门攻击。后门攻击通过在训练数据中注入触发模式,使模型在特定输入下产生恶意行为,同时保持正常任务性能;防御手段通常分为针对脏标签(dirty-label)与干净标签(clean-label)攻击两类,但缺乏通用性。作者构建了干净/被投毒模型在正常/触发输入下的2×2对比矩阵,将后门引起的logit偏移追溯到高贡献的SAE特征,并将这些特征划分为四类角色:交互特征(interaction)、抑制特征(suppressed)、混合特征(mixed)和权重修改特征(weight-modified)。分析揭示了两类后门在特征编码上的系统性差异:脏标签后门主要由孤立的交互特征主导,而干净标签后门更依赖于混合特征与权重修改特征的异质组合。这一差异从机制上解释了为何现有防御在不同攻击范式下表现碎片化。为验证假设,作者提出了推理时特征钳制(inference-time feature clamping)方法,在大多数脏标签设置下将攻击成功率(ASR)降至10.8%以下,在多数干净标签设置下降至15.4%以下,同时保持良性任务性能。结果表明,基于SAE的分析不仅能解释防御碎片化的根源,还能指导可解释的后门缓解策略。该研究适合关注LLM安全、后门防御、可解释AI以及机制可解释性的研究人员与安全工程师阅读,为开发更统一、更通用的防御框架提供了新视角。

💡 推荐理由: 首次从特征机制层面解释LLM后门防御碎片化根因,用SAE统一分析脏标签/干净标签攻击,为设计可解释且通用化的后门缓解方案提供理论基础,对安全研究与防御落地有重要启发。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shuo Shao 0002, Yiming Li 0004, Hongwei Yao, Yiling He, Zhan Qin, Kui Ren 0001

本文提出了一种名为“解释即水印”(Explanation as a Watermark) 的神经网络模型所有权验证方案,旨在解决深度学习模型被窃取或未经授权复用时的归属认定问题。传统模型水印方法通常直接修改模型参数或输出,可能会影响模型在正常任务上的性能,且容易被去除或篡改;本文则创新性地将水印信息嵌入到模型的特征归因解释 (Feature Attribution) 中,使模型在对待特定触发样本进行推理时,产生带有预设模式的解释结果,该模式即可编码多位水印信息。具体而言,作者设计了一种端到端的训练框架,在保持原任务精度基本不变的前提下,联合优化模型参数以同时满足任务损失和水印嵌入损失,使得只有持有密钥的验证方才能从解释中提取出完整水印。实验在多种图像分类数据集和不同模型架构上验证了该方法的有效性,表明其具有较好的保真性、鲁棒性和安全性,能够抵抗常见的后处理攻击(如微调、剪枝、水印去除等)。本文的主要贡献包括:提出首个利用解释本身作为水印载体的无损所有权验证机制;支持多位水印编码,信息容量高于传统二值水印;并给出了理论分析和系统实验评估。适合对模型知识产权保护、AI安全与可解释性交叉领域感兴趣的的研究者、AI模型提供方及安全审计人员阅读。

💡 推荐理由: 为AI模型所有权验证提供了新思路,利用可解释性作为水印载体,降低对模型性能的影响,增强了水印的抗去除能力,对保护模型知识产权有实际意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Federica Uccello, Simin Nadjm-Tehrani

该论文针对网络安全监控中基于机器学习的异常检测方法存在的可解释性不足问题展开研究。现有方法要么依赖特征归因技术但忽略特征间依赖关系,要么依赖因果建模但需要大量领域知识或计算资源。为此,作者提出 XION 方法,仅基于良性流量建模网络流特征之间的关系。在检测阶段,通过特征依赖关系的违反情况来识别异常;在告警后分析阶段,XION 能够指出哪些特征关系被破坏、在攻击时间线上的哪个时刻被破坏,以及不同依赖违反之间如何演化。作者在标准 IDS 数据集上评估了 XION,并与隔离森林(IF)基线在多种攻击场景下(包括大流量攻击和隐蔽攻击)进行了比较。结果表明,在所有评估场景中,XION 的召回率匹配或超过 IF,同时推理时间最多缩短 7 倍。在告警后阶段,依赖违反分析揭示出与已知攻击行为一致的时间和结构模式,而 IF 无法提供这类信息。这些发现证实攻击确实会破坏从良性流量中学到的特征依赖,且这些破坏能为理解告警提供额外信息。

💡 推荐理由: 该研究为网络流量异常检测提供了一种可解释且高效的方法,能帮助蓝队理解告警背后的特征依赖断裂原因,提升安全运营中对 ML 告警的信任度和调查效率。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: XiuYu Zhang, Bonan Ruan, Junfeng Fang, An Zhang, Tat-Seng Chua, Zhenkai Liang

本文提出了一种名为 Language Model Security Modules (LMSM) 的安全框架,受 Linux 安全模块 (LSM) 的架构启发,旨在解决大型语言模型 (LLM) 部署中分层防御仍可能被恶意提示绕过的问题。研究者指出,现有可解释性方法能够暴露模型生成路径上的内部信号,但这些信号本身并非安全控制;若将其用于安全防护,通常需要为每个信号单独编写校准、策略逻辑和干预代码,导致集成成本高且无法形成统一防御。LMSM 将 LSM 的职责分离思想引入 LLM 服务流程:选定的安全后端提供校准证据,带版本化的策略引擎基于可信的每请求上下文评估活动规则,独立的门控模块则授权缓冲输出的释放。这一设计将仲裁正确性与策略有效性解耦,允许在不重建请求处理或强制逻辑的情况下更换后端、规则或调度策略。原型实现基于 Hugging Face Transformers 和连续批处理 vLLM,验证了同一基础设施可承载基于稀疏自编码器 (SAE)、transcoder 以及任务适配密集探针的多种部署,并在调度器扰动下保持请求级决策的一致性,同时支持每条请求选择性执行和组合多条规则。在 Qwen3-4B 模型上,LMSM-Checkpoint 将 HarmBench 攻击成功率从 39.20% 降至 3.32%,XSTest 误拒率从 2.40% 上升至 4.40%,且在 32 个活动序列下保留了无监控服务路径 98.14% 的吞吐量。该框架为可解释性和模型内部分析的进展提供了通往运行时强制执行的统一路径。

💡 推荐理由: 为 LLM 运行时安全提供了一种可扩展的模块化框架,能统一多种安全信号并降低集成成本,同时保持高吞吐,对实际部署防线建设有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Arthur Nijdam, Paul Stankovski Wagner, Sara Ramezanian

该论文提出 CyberBridge,一个自动将网络安全职位描述映射到专业角色画像的框架。研究背景是网络安全领域快速演进,学术课程难以跟上行业实际能力需求。CyberBridge 通过将职位空缺描述分解为知识、技能、任务(KST)陈述,使用 sentence-BERT 模型进行嵌入,并与最语义相似的行业画像匹配。其关键贡献在于可解释性:它不是黑盒,而是能让用户追溯到推动每个匹配的具体能力项,并生成人类可读的推荐理由。框架支持三个主要用例:(1) 职位推荐——根据学生已完成的课程推荐空缺职位及高度匹配的专业角色;(2) 市场分析——帮助教育者和课程开发者分析当前哪些角色需求旺盛;(3) 课程规划——评估哪些课程方案最能让学生为热门网络安全岗位做好准备。因此,CyberBridge 可作为教育机构在网络安全教育中提供职业指导和循证课程开发的实用工具。

💡 推荐理由: 该研究为网络安全教育提供了自动化衔接行业的可解释工具,帮助课程设计与市场需求对齐,对教育者、学生和安全团队人才招聘均有参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Mateo Espinosa Zarlenga

该论文重新审视了基于概念模型(Concept-based Models, CMs)中信息泄漏的传统观点。CMs是一类深度神经网络,其预测基于与人类可理解概念(如“圆形”、“条纹”等)对齐的表示。过往研究通常认为,CMs会学习到泄漏概念无关信息的表示,这种泄漏被视为不可取的,应予以消除,因为它会导致模型不可解释。然而,本文作者指出,这一传统观点在两方面存在缺陷:首先,泄漏导致模型不可解释的证据往往不具决定性;其次,在现实世界中常见概念不完备(concept incompleteness)的约束下,完全消除泄漏会导致模型不实用。作者论证,在概念不完备成为常态的实际场景中,一定程度的泄漏对于构建准确且可干预(intervenable)的CMs是必要的。据此,他们提出了“良性泄漏”(benign leakage)的概念,并通过重新构建典型的CM训练目标,使得模型能够主动鼓励并利用这种良性泄漏,而不会牺牲预测准确性或干预能力。论文通过理论分析和实验验证,展示了所提方法在多个基准上的有效性。该研究为CMs的设计提供了新视角,有助于在保持可解释性的同时提升模型实用性。适合机器学习、可解释AI领域的研究者和从业者阅读。

💡 推荐理由: 颠覆了概念模型必须消除信息泄漏的固有认知,提出了良性泄漏的新范式,对设计既准确又可干预的现实CMs具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Dongqi Han, Zhiliang Wang, Wenqi Chen, Ying Zhong, Su Wang, Han Zhang 0009, Jiahai Yang 0001, Xingang Shi, Xia Yin 0001

论文《DeepAID: Interpreting and Improving Deep Learning-based Anomaly Detection in Security Applications》聚焦于安全领域中基于深度学习的无监督异常检测模型的可解释性问题。尽管深度神经网络在检测未知威胁方面表现出色,但其缺乏可解释性严重阻碍了实际部署。现有解释方法主要针对监督学习模型和非安全领域设计,无法直接适用于无监督模型,也难以满足安全领域的特殊需求(如误报分析、攻击溯源等)。为此,作者提出DeepAID框架,旨在为无监督深度学习异常检测模型提供解释。该方法通过分析模型内部表示和决策边界,生成与异常检测任务语义一致的解释,并利用解释结果指导模型改进,提升检测性能。实验在多个安全数据集(如网络入侵检测、恶意软件检测)上验证了DeepAID的有效性:相比基线方法,DeepAID生成的解释更准确、更符合安全专家认知,且能有效帮助安全分析师理解异常原因、减少误报。此外,作者还展示了如何利用解释反馈优化模型,使检测精度进一步提升。该工作为深度学习模型在安全运维中的可信应用提供了重要支撑。

💡 推荐理由: 可解释性是深度学习模型在安全运维中落地的主要障碍,DeepAID专门针对无监督异常检测场景提出解决方案,直接提升蓝队对模型输出的信任和可用性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuyou Gan, Yuhao Mao, Xuhong Zhang 0002, Shouling Ji, Yuwen Pu, Meng Han, Jianwei Yin, Ting Wang 0006

本文针对特征归因(Feature Attribution)解释方法的鲁棒性评估问题展开研究。特征归因是解释机器学习模型预测结果的一种常见技术,通过为输入特征分配重要性分数来指示其对模型输出的贡献。然而,现有研究指出,这些解释可能对输入中的微小扰动高度敏感,即存在鲁棒性问题。本文提出一个系统性的鲁棒性评估框架,用于量化特征归因解释在面对输入扰动时的稳定性。该框架首先定义了一系列鲁棒性度量指标,如最大扰动幅度下的解释变化程度,并设计了高效的优化算法来寻找最坏情况下的扰动。实验在多个数据集和多种归因方法(包括梯度类、扰动类和代理模型类方法)上进行验证。结果表明,不同归因方法的鲁棒性存在显著差异,且鲁棒性与解释的保真度、稀疏性等属性并非正相关。该工作为特征归因解释的可靠性评估提供了标准化工具,有助于理解解释方法的局限性并指导后续改进。

💡 推荐理由: 特征归因解释的鲁棒性是模型可解释性领域的关键问题,直接影响用户对AI决策的信任。本框架为评估和比较不同归因方法提供了量化标准,对安全审计、合规检查和模型调试有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)