#model-extraction

共收录 9 条相关安全情报。

← 返回所有主题
推荐 9.6
Conf: 50%
👥 作者: Yanjiao Chen, Rui Guan, Xueluan Gong, Jianshuo Dong, Meng Xue 0001

本文提出了一种名为 D-DAE 的防御穿透式模型提取攻击框架,旨在突破基于扰动查询结果的模型提取防御。近年来研究表明,机器学习模型易受模型提取攻击:攻击者仅通过查询黑盒受害者模型,即可训练出一个性能接近的替代模型。为抵御此类攻击,防御方往往在返回查询结果前加入扰动,从而显著降低现有模型提取攻击的性能。D-DAE 首次系统性地尝试绕过这类扰动型防御,其核心包含两个模块:扰动检测模块与扰动恢复模块,二者可集成到通用模型提取攻击流程中。扰动检测模块在收到受害者模型返回的查询结果后,推断防御方采用的扰动机制;作者设计了一种基于元学习的检测算法,用于学习被扰动与未扰动查询结果分布之间的本质差异,该算法具有良好的泛化能力,即使无法访问受害者模型的原始训练数据也能有效工作。在检测到防御机制后,扰动恢复模块利用精心设计的生成模型,从被扰动的查询结果中恢复出干净的查询结果。作者在 MNIST、FashionMNIST、CIFAR-10、GTSRB 和 ImageNette 数据集上进行了广泛评估,实验表明,面对 4 种最先进的防御方法及其组合时,D-DAE 能将现有模型提取攻击的替代模型准确率最多提升 82.24%。此外,作者还验证了 D-DAE 在穿透 Microsoft Azure 和 Face++ 提供的真实世界 API 中未知防御的有效性。该研究揭示了当前扰动型防御的脆弱性,为设计更鲁棒的模型保护机制提供了新的视角。适合关注 AI 安全、模型窃取攻击与防御的研究人员、安全工程师及云服务提供商阅读。

💡 推荐理由: 首次提出穿透扰动型防御的模型提取攻击框架,证明现有防御手段可被系统性绕过,对依赖查询扰动的模型保护方案敲响警钟,推动更鲁棒的防御设计。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yan Wen, Zhenyi Wang, Heng Huang

图神经网络(GNN)是机器学习即服务(MLaaS)中高风险应用的核心技术,但其黑盒部署模式易受模型提取(Model Extraction)攻击:攻击者通过查询API窃取模型知识产权。现有防御措施存在根本性的'欧几里得偏差'——它们直接将图像领域的扰动策略(如随机噪声)迁移到图数据上,忽略了图节点间复杂的拓扑依赖,导致模型效用大幅下降;而水印等被动防御无法实时阻断窃取。针对这一问题,本文提出GraphRP(Graph Reprogramming Protection)——一个基于模型重编程的主动防御框架,将模型重编程思想转化为安全防护机制。GraphRP的核心里程碑在于提出结构感知门控机制(Structure-Aware Gating Mechanism),该机制由可学习的拓扑原型驱动,构建一道动态的'结构防火墙',能够选择性地调节模型决策边界:对位于训练数据流形上的良性查询保持高保真度,而对恶意查询则沿扰动方向最大化Fisher信息,从信息论层面增大攻击者的估计误差。作者在标准假设下(有界损失、最优攻击者、局部二阶近似)证明了攻击者误差的下界将随重编程噪声的结构敏感性而增加,从理论上验证了该方法的有效性。实验覆盖软标签与硬标签两类主流模型提取攻击,结果表明GraphRP能显著降低攻击成功率,同时几乎不影响良性查询的效用。该研究首次将模型重编程引入GNN防御领域,为保护图模型知识产权提供了全新思路,特别适合ML安全研究员、MLaaS服务提供商及GNN部署方阅读。

💡 推荐理由: GNN在MLaaS中广泛部署,模型提取攻击可导致核心知识产权泄露。现有防御因忽略图拓扑而失效,GraphRP作为主动防御新思路,能有效平衡安全性与效用,值得安全从业者关注。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zirui Chen, Shi Tang, Zhengchao Gao, Yongjia Su, Lingyue Qin, Xiaoyang Dong

本文针对神经网络模型提取攻击在硬标签(hard-label)场景下的计算效率瓶颈,提出了一种基于代数方法的近似签名向量(ASV)技术。现有最优攻击由 Carlini 等人在 EUROCRYPT 2025 提出,理论上具有多项式时间复杂度,但其核心的双点聚类依赖于奇异值分解(SVD),时间复杂度为 O(n^2*(d^(k))^3),实际运行开销巨大。为克服这一瓶颈,作者将 Carlini 等人的几何视角硬标签攻击转化为代数框架,利用两个关键观察:高维随机向量近似正交,以及实际深度神经网络中神经元倾向于学习解纠缠特征,从而提出 ASV 方法,将基于 SVD 的秩检查替换为简单的内积运算,使聚类复杂度降至 O(n*(d^(k))^3) 平均复杂度。此外,论文首次提出了针对硬标签最大池化卷积神经网络(CNN)的模型提取攻击,通过提出一种以卷积核为中心的聚类方案的改进 ASV 方法,替代传统的神经元中心聚类,充分利用了卷积中的权重共享特性,填补了 CNN 硬标签模型提取的密码分析空白。实验在 64-64×4-10 FCNN 和带最大池化的 LeNet-5 CNN 上进行,结果表明 ASV 方法大幅削减了聚类时间,并提升了模型提取的整体效率。该研究主要面向安全研究社区,特别是从事模型窃取攻击与防御、机器学习即服务(MLaaS)安全性研究的人员,为理解硬标签场景下的高效模型提取提供了新的代数视角和实用方法。

💡 推荐理由: 该研究显著提升了硬标签神经网络模型提取攻击的效率,将聚类复杂度从平方级降至线性级,并首次扩展到带最大池化的 CNN,对评估 MLaaS 中模型泄露风险具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhongjiang Yao, Shuangshuang Liang, Chun Yang, LiWei Chen, Gang Shi

随着越来越多模型服务以“公共基础模型 + 私有参数高效微调(PEFT)适配”的方式部署,一种新型的差分信息泄露风险逐渐显现:审计者或攻击者可以在本地运行公开的基础模型,并对比受害者服务的输出,从而推断出私有 PEFT 适配的结构。本文提出 VectorHijack-SR,一种系统性的测量方法,将成对的受害者/基础模型残差转换为经过校准的结构边界,覆盖 PEFT 家族、层局部性以及粗粒度秩,并区分元数据可见性、开放世界有效性与操作可利用性。该方法通过聚合查询级幅度、排序、熵、边际、长度、模板、局部性和频谱统计,形成服务级表示;利用服务不相交的分类器量化结构证据,并通过交叉拟合的分层拒绝器判断受害者样本是否落在校准的 LoRA 流形之外。实验在多个分类骨干上验证:家族泄露显著超过随机机会,例如 BERT/MNLI 上 8/12、RoBERTa/MNLI 上 21/24、DeBERTa-v3 在 MNLI 上 12/18 与 AG News 上 15/18;秩推断则呈现任务依赖性,BERT/MNLI 与 DeBERTa/AG News 达到 8/9,而 DeBERTa/MNLI 仅 4/9,经校正后与随机机会兼容。在十个种子的 BERT 开放集网格上,拒绝器达到池化 AUROC 0.804(95% CI [0.660, 0.927])和已知准确率 0.956,但对结构接近的 DoRA 和 LoRA+head 变体泛化有限。五个留出 LoRA-r64 服务的精确版本链接 AUC 达到 0.940。此外,实验揭示“可见性—可利用性”差距:两阶段恢复无法带来公平预算下的查询节省,后验选择的 PEFT 性能低于蒸馏后转换的 PEFT(0.356 对比 0.517),自由运行生成仍接近随机。整体结论是:在基础模型已知且输出信息丰富的情况下,PEFT 服务可能泄露可操作的结构与版本信息;但仅凭闭集置信度并不能确证通用的适配器恢复能力。该研究适用于模型服务提供商、安全审计者以及从事 PEFT 隐私风险研究的人员。

💡 推荐理由: 该研究首次系统量化了黑盒条件下 PEFT 适配的结构信息泄露风险,提示使用公共基座+私有微调的服务可能被逆向出家族、层位置甚至版本信息,直接影响模型知识产权与数据隐私,值得所有部署此类服务的蓝队关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.6
Conf: 50%
👥 作者: Ali Naseh, Kalpesh Krishna, Mohit Iyyer, Amir Houmansadr

本文首次展示了一种攻击方法,能够通过仅对语言模型(LM)进行典型的API访问,以极低的经济成本窃取其解码算法的类型和超参数。解码算法是语言模型生成文本的关键组件,决定了如何从LM输出的内部概率分布中选出文本。选择和调优解码算法需要大量时间、人工努力和计算资源,并且需要广泛的人工评估,因此其身份和超参数对模型拥有者极具价值。攻击针对GPT-2、GPT-3和GPT-Neo等流行文本生成API所用LM,作者证明了仅需几美元(例如,针对GPT-3的四个版本分别只需0.8、1、4和40美元)即可成功窃取这些信息。该攻击通过精心设计的输入输出查询,利用模型行为差异推断解码算法类型及参数设置。研究揭示了API感知的模型机密信息泄露风险,对模型提供商的商业秘密和知识产权保护提出警示。适合安全研究人员、AI模型提供商及依赖第三方LLM API服务的组织阅读。

💡 推荐理由: 首次证明从公开API中窃取语言模型解码算法(商业机密)的可行性,且成本极低,对模型所有者的知识产权构成直接威胁。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shuze Liu, Qianwen Guo, Yushun Dong

本研究针对大型语言模型(LLM)通过托管API部署时面临的模型提取攻击威胁。模型提取攻击中,攻击者通过发送大量查询来窃取或复制目标模型的功能,但单个查询往往与正常用户请求难以区分。现有检测方法多基于单条查询异常评分或纯良性用户与攻击者用户分类场景,缺乏对混合多用户流量中攻击的有效检测。本文提出一种简单有效的检测方法:将传入查询嵌入语义空间,然后利用最大均值差异(MMD)检验其聚合分布是否偏离历史良性流量。具体地,仅通过良性流量之间的比较来设定决策阈值,无需攻击样本。在四种提取场景、十四个攻击者-正常查询对上的实验表明,该方法在三种随机种子下实现了0.3%的良性假阳性率、100.0%的纯攻击者检测率、90.5%的平均攻击者检测率和95.1%的平衡准确率。与PRADA、SEAT、CAP、DATE和边际马氏距离等基线方法相比,该方法效果显著。代码已开源。本文核心贡献在于将模型提取检测视为良性校准的流量窗口分布测试问题,并证明了简单方法在混合多用户环境下的有效性。适合关注LLM安全、模型窃取防御的研究人员和工程师阅读。

💡 推荐理由: LLM API服务面临模型提取威胁,现有检测方法在混合流量中效果不佳。本文提出的轻量级分布测试方法无需攻击样本即可高效检测,为API安全防护提供了实用基线。

🎯 建议动作: 研究跟进该检测方法,评估在自身LLM API流量中的适用性

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kaixiang Zhao, Bolin Shen, Yuyang Dai, Shayok Chakraborty, Yushun Dong

该论文提出了 GraphIP-Bench,一个用于系统评估图神经网络(GNN)模型窃取攻击与防御的统一基准。作者指出,现有研究因数据集、威胁模型和评估指标不一致而无法回答“窃取GNN有多难”以及“能否阻止”这两个关键问题。GraphIP-Bench 在统一的黑盒协议下集成了12种模型提取攻击、12种防御方法(涵盖水印、输出扰动和查询模式检测三类)、10个公开图数据集(包含同质、异质和大规模图)、3种GNN骨干网络和3种图学习任务,并报告了保真度、任务效用、所有权验证和计算成本等指标。此外,还增加了联合攻击-防御赛道,对每个受保护目标运行所有攻击,并测量提取后替代模型上的水印验证效果。实验结果表明:在中等查询预算下,窃取GNN很容易,且大多数防御未能改变这一现状;多种水印在受保护模型上可靠验证,但在提取的替代模型上几乎失去验证信号,这暴露了单一模型评估遗漏的漏洞;异质图更难以窃取,而目标与替代模型之间的跨架构不匹配会降低但无法阻止提取。论文提供了开源代码。该研究对安全从业者理解GNN模型窃取风险及评估防御有效性具有重要参考价值。

💡 推荐理由: GNN云服务面临模型窃取攻击威胁,而现有评估缺乏统一标准。本文首次系统对比攻击与防御,揭示多数防御无效、水印易被移除等关键发现,为安全团队制定防护策略提供了实证依据。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Zhengyi Li, Yakai Wang, Kang Yang, Yu Yu, Jiaping Gui, Yu Feng, Ning Liu, Minyi Guo, Jingwen Leng

本文针对Transformer模型安全推断中的shuffling防御机制展开研究。在安全推断场景中,客户端通过加密协议仅获知模型最终输出,而服务器无法得知客户端输入。然而,非线性层的安全计算因通信轮数和数据传输量巨大而成为效率瓶颈。为提升效率,先前工作选择向客户端暴露中间激活值,使其可以在明文下计算非线性操作,但这一做法使得敌手可能从暴露的激活中提取模型权重。作为缓解措施,现有工作采用shuffling防御,即仅向客户端公开经过随机排列后的激活值,期望通过破坏激活值与权重的对应关系来阻止模型提取。本文证明该shuffling防御远不如先前声称的稳健。作者提出一种攻击方法,首先将不同轮次中经过不同随机排列的激活值对应到同一个排列空间(即对齐),进而利用这些对齐后的激活值恢复模型权重。具体地,攻击者通过观察多次推理中暴露的shuffled激活,利用激活值之间的统计关联推断出排列关系,实现高精度对齐。在Pythia-70m和GPT-2上的实验表明,所提出的攻击可以将shuffled激活对齐到均方误差仅为10^{-9}到10^{-6}的水平。进一步,在查询成本约为1美元的条件下,敌手恢复出的模型权重与真实权重之间的L1范数差异仅为10^{-4}到10^{-2},几乎完全恢复。该工作揭示了shuffling防御的根本缺陷,提示安全推断设计中需要更加稳健的保护机制。

💡 推荐理由: shuffling防御曾被认为是保护模型权重的有效方案,本论文证明其本质上不安全,攻击者能以极低成本(约1美元)恢复Transformer模型权重,对依赖该技术的安全推断系统构成直接威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hao Luan, Xue Tan, Zhiheng Li, Jun Dai 0001, Xiaoyan Sun 0003, Ping Chen 0003

本文提出一种基于自监督学习的模型提取攻击方法,旨在同时实现数据集缩减和水印移除。传统模型提取攻击通常需要大量查询和完整训练数据,且可能保留原始模型的水印。作者利用自监督学习(如对比学习)从目标模型中提取知识,仅需少量未标记样本即可训练一个紧凑的替代模型。该方法通过构建正负样本对进行对比学习,使替代模型模仿目标模型的表示空间,从而在减少数据集规模(例如仅需原始数据集的10%)的同时,有效消除嵌入在目标模型中的水印。实验在多个图像分类数据集(CIFAR-10, CIFAR-100, SVHN)和不同架构(ResNet, VGG)上进行,结果显示替代模型在保持高准确率(接近目标模型)的同时,水印移除成功率显著高于基线方法。该研究揭示了自监督学习在模型窃取中的潜力,对模型水印保护机制构成新挑战。

💡 推荐理由: 该研究暴露了自监督学习可被用于高效模型窃取并绕过水印保护,威胁模型知识产权和安全性,需引起防御方重视。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)