#model-stealing

共收录 7 条相关安全情报。

← 返回所有主题
👥 作者: Zirui Chen, Shi Tang, Zhengchao Gao, Yongjia Su, Lingyue Qin, Xiaoyang Dong

该论文针对卷积神经网络(CNN)中最大池化层的参数提取攻击进行了系统研究。参数提取攻击旨在通过黑盒输入-输出查询恢复深度神经网络的权重和偏置,此前已在基于ReLU的全连接神经网络(FCNN)上得到广泛探索,但在包含最大池化层的CNN中仍是空白。最大池化层引入了额外的非线性,并隐藏了ReLU的关键点,导致现有的FCNN提取方法无法直接适用。作者提出了首个针对具有最大池化功能的CNN的密码分析提取攻击。首先,建立了CNN的代数表示,形式化地证明了CNN是分段线性函数,从而可以扩展基于线性原理的提取方法。其次,识别出CNN中两类新型关键点:ReLU-池化关键点(RPCPs)和池化切换点(PSPs)。针对这两类关键点,设计了互补的提取技术:针对RPCPs的基于模式匹配的方法用于恢复部分签名和符号;针对PSPs的内部差分提取攻击(受密码学内部差分分析启发)用于恢复高精度签名。由于PSP比RPCP丰富得多,且提取效率高,而RPCP对于偏置恢复不可或缺,因此将两者集成:PSP方法实现高效签名提取,单个RPCP恢复符号和偏置。作者在多个CNN架构上进行了评估,包括在随机数据、MNIST和CIFAR-10上训练的现代LeNet-5变体。实验结果表明,该方法在多项式查询复杂度和运行时间内实现了高提取精度,即使对于深层CNN层也有效。该工作填补了CNN安全中的研究空白。

💡 推荐理由: 该研究首次揭示了CNN最大池化层在参数提取攻击下的脆弱性,扩展了模型窃取攻击的适用范围,对部署CNN模型的安全团队具有重要参考价值,尤其是依赖黑盒API的场景。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Sadegh Majidi, Niloofar Mireshghallah, Kazem Taram

该论文提出了一种名为 LeakyLMs 的攻击方法,通过分析语言模型生成每个 token 的耗时(per-token timing),从远程 API 接口中窃取模型架构和推理优化部署细节,无需直接访问模型内部结构。攻击分为两部分:第一部分针对推理优化和部署策略,能够检测出提供商是否使用了推测解码(speculative decoding)等优化技术,并识别出草稿模型的上下文长度。例如,测量发现 Google Gemini Flash 2.5 使用了推测解码,且草稿模型上下文窗口约为 128K tokens。第二部分攻击旨在恢复模型的关键架构属性,包括 Transformer 层数、隐藏层维度和注意力头数。为实现这一点,LeakyLMs 构建了一个详细且准确的 token 生成时序模型,该模型基于现代 NVIDIA GPU 的硬件特性,刻画了延迟与模型配置及硬件参数的关系。随后,攻击利用该时序模型在架构空间中进行搜索,通过比较实际时序与预测时序来推断最可能的配置。在 Llama 系列模型上的实验表明,近正确的架构配置在 top-10 猜测中出现的概率超过 90%。该工作揭示了即使通过黑盒 API,仅凭 token 级别的时序信息也能泄露高度敏感的模型细节,对当前商业和开源 LLM 服务的机密性构成威胁。适合安全研究员、模型开发者及 LLM 服务提供商阅读。

💡 推荐理由: 首次证明仅通过远程 API 的 token 生成时序即可推断 LLM 架构细节和推理优化策略,揭示了一种隐蔽的信息泄露通道,威胁模型知识产权和商业机密。

🎯 建议动作: 评估自身 LLM 部署是否面临此类计时侧信道风险;考虑在 API 响应中添加随机延迟或限制时序精度。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christopher Ellis, Shreyas Chaudhari, Mei-Yu Wang, Leighton Barnes, Giulia Fanti, José M. F. Moura

这篇论文研究了在API访问受到严格限制的情况下,如何推断大语言模型(LLM)的底层架构属性。当前大多数商业LLM供应商不再公开模型架构细节,且API只返回每个解码token的单一logit值,不再提供logit偏置功能。作者提出了NightVision攻击方法,利用这种限制性黑盒API来估计LLM的隐藏维度、深度和参数量。NightVision的核心创新包括一种共同集提示技术:通过多个提示暴露相同输出token集合的对数概率,然后对这些结果进行光谱分析以推断隐藏维度。此外,利用端到端到第一个token的时间(TTFT)测量值,结合估计的隐藏维度,进一步估计深度和参数量。实验在32个开源LLM上进行,结果表明隐藏维度的平均相对误差为23%(在MoE模型上为9%),对于超过30亿参数的模型,深度和参数量的估计误差在53%以内。广泛的消融实验展示了这些精度如何随token预算和模型属性变化。总体而言,研究证实了当前LLM API的限制不足以完全隐藏模型的架构细节,为模型窃取和逆向工程提供了新的攻击面。该论文适合安全研究员、LLM服务提供商以及关注模型知识产权保护的研究者阅读。

💡 推荐理由: 该工作揭示了即使在最严格的API限制下,攻击者仍能推断LLM的核心架构参数,威胁模型知识产权和商业保密。对安全从业者而言,这表明现有API保护措施不足,需设计更强健的防御机制。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rui Wen 0002, Michael Backes 0001, Yang Zhang 0016

本论文研究了机器学习中数据重要性(data importance)与各类攻击脆弱性之间的关系。尽管已有工作表明不同训练样本对模型效用的贡献存在差异,但“高价值数据是否更容易受到攻击”这一关键问题尚未被系统回答。作者分析了五种典型攻击类型(包括成员推断、模型窃取等),发现高重要性样本在成员推断和模型窃取攻击中表现出更高的脆弱性。具体而言,通过将样本特征整合到成员指标中(引入样本特定标准),成员推断的性能得到显著提升。该发现揭示了数据价值与攻击风险之间的正向关联,强调了在设计防御机制时需要平衡模型效用与高价值数据保护。实验部分对多种数据集和模型架构进行了验证,结果表明该现象具有普遍性。论文的核心贡献在于首次系统性地量化了数据重要性对不同攻击类型的影响,并提出了利用重要性信息增强成员推断的新思路。适合机器学习安全、隐私保护领域的研究者和安全工程师阅读。

💡 推荐理由: 揭示了高价值训练样本更容易成为攻击目标,为数据分类保护、差异化防御策略提供了理论依据,有助于优先保护关键数据。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tianshuo Cong, Xinlei He 0001, Yang Zhang 0016

自监督学习作为一种新兴的机器学习范式,利用无标签数据预训练强大的编码器,这些编码器可作为特征提取器服务于各种下游任务。然而,由于预训练过程需要大量数据和计算资源,编码器本身成为模型所有者的宝贵知识产权。研究表明,模型窃取攻击通过训练替代模型来模仿原始模型行为,严重威胁版权保护。现有版权保护方法(如水印)主要针对分类器,而预训练编码器的版权保护面临独特挑战。本文提出 SSLGuard,首个专为预训练编码器设计的水印方案。SSLGuard 在干净的预训练编码器中注入水印,生成带水印版本,并采用影子训练技术确保水印在潜在模型窃取攻击下仍可保留。通过大量实验,SSLGuard 在水印注入与验证上表现出色,且对模型窃取、输入噪声、输出扰动、覆盖攻击、模型剪枝和微调等水印移除攻击具有鲁棒性。该工作填补了预训练编码器版权保护的空缺,为 AI 模型知识产权保护提供了新思路。

💡 推荐理由: 自监督学习编码器作为核心资产,面临模型窃取威胁。SSLGuard 首次提供水印保护方案,对保护企业 AI 模型版权、防止滥用具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Eliott Baltz, Satoshi Hara, Ulrich Aïvodji

该论文从模型多重性的角度重新审视了模型窃取攻击的传统观点。通常认为,攻击者通过查询目标模型构建高保真代理模型,可以获得与原始服务提供商相近的经济优势。然而,论文指出由于查询提取只能提供目标模型输入输出行为的部分监督,代理模型并非唯一确定:存在多个近最优代理模型(即Rashomon Set),它们在保真度上相似,但在部署相关的其他性能指标(如公平性、鲁棒性等)上可能存在显著差异。作者没有采用经典的基于学习的模型窃取攻击,而是通过计算代理模型的Rashomon Set,并使用多重性指标(模糊性、差异性、Rashomon容量)和群体公平性指标来评估其多样性。在表格数据、医学影像和NLP任务上的实验表明,尽管代理模型对目标模型的保真度相近,但在其他关键性能指标上可能存在巨大差异。这些发现质疑了高保真代理模型与目标模型在实际部署场景中等价性的假设,对模型窃取攻击的风险评估提供了新的视角。

💡 推荐理由: 该论文挑战了模型窃取攻击中'高保真代理即等价于原始模型'的传统认知,揭示了代理模型在保真度之外的其他性能维度存在显著不确定性,对评估模型知识产权风险具有重要的理论指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Maxime Schwarzer, Laurin Holz, Tobias Huerten, Johannes Loevenich, Thies Moehlenhof, Roberto Rigolin F. Lopes, Veit Hagenmeyer

该论文针对能源基础设施中基于人工智能的入侵检测系统(IDS)面临的模型窃取攻击问题,提出了一种新型防御方法FlowGuard。模型窃取攻击允许攻击者通过查询IDS来复制其决策边界,从而离线生成逃避检测的恶意流量。现有防御方法存在两个主要缺陷:一是基于身份的查询监控(如PRADA)无法抵御分布式攻击(Sybil攻击),因为攻击者可以伪装成多个独立客户端;二是通过软标签扰动进行预测中毒的方法不适用于硬标签IDS(只能输出离散类别)。FlowGuard利用流匹配(Flow Matching)技术,在不依赖查询者身份的前提下,通过在IDS处理之前将传入查询分类为分布外(OOD)样本进行防御。其核心思想是:用于数据无关模型窃取攻击(如MAZE、DisGUIDE)的合成查询通常位于比真实网络流量更低维度的流形上,因此使用已在合法数据上训练的连续归一化流(Continuous Normalizing Flow)计算出的对数似然值会显著更低。实验部分,作者在单客户端和分布式(100客户端Sybil)设置下,针对PRADA和FDINet方法进行评估。结果表明,当数据分布变化时,PRADA的检测率降至0%,而FlowGuard在两个设置下均保持稳定的检测率,且不依赖身份信息。论文还讨论了该方法的适用范围和局限性,并提出了对数据相关攻击的潜在应用方向。适合安全研究人员、IDS开发者和能源系统安全工程师阅读。

💡 推荐理由: 该工作填补了硬标签IDS场景下抗模型窃取防御的空白,且不依赖客户端身份,能应对分布式Sybil攻击,对保护能源关键基础设施的机器学习模型具有实际意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)