#defense-evasion

共收录 2 条相关安全情报。

← 返回所有主题
推荐 9.6
Conf: 50%
👥 作者: Yanjiao Chen, Rui Guan, Xueluan Gong, Jianshuo Dong, Meng Xue 0001

本文提出了一种名为 D-DAE 的防御穿透式模型提取攻击框架,旨在突破基于扰动查询结果的模型提取防御。近年来研究表明,机器学习模型易受模型提取攻击:攻击者仅通过查询黑盒受害者模型,即可训练出一个性能接近的替代模型。为抵御此类攻击,防御方往往在返回查询结果前加入扰动,从而显著降低现有模型提取攻击的性能。D-DAE 首次系统性地尝试绕过这类扰动型防御,其核心包含两个模块:扰动检测模块与扰动恢复模块,二者可集成到通用模型提取攻击流程中。扰动检测模块在收到受害者模型返回的查询结果后,推断防御方采用的扰动机制;作者设计了一种基于元学习的检测算法,用于学习被扰动与未扰动查询结果分布之间的本质差异,该算法具有良好的泛化能力,即使无法访问受害者模型的原始训练数据也能有效工作。在检测到防御机制后,扰动恢复模块利用精心设计的生成模型,从被扰动的查询结果中恢复出干净的查询结果。作者在 MNIST、FashionMNIST、CIFAR-10、GTSRB 和 ImageNette 数据集上进行了广泛评估,实验表明,面对 4 种最先进的防御方法及其组合时,D-DAE 能将现有模型提取攻击的替代模型准确率最多提升 82.24%。此外,作者还验证了 D-DAE 在穿透 Microsoft Azure 和 Face++ 提供的真实世界 API 中未知防御的有效性。该研究揭示了当前扰动型防御的脆弱性,为设计更鲁棒的模型保护机制提供了新的视角。适合关注 AI 安全、模型窃取攻击与防御的研究人员、安全工程师及云服务提供商阅读。

💡 推荐理由: 首次提出穿透扰动型防御的模型提取攻击框架,证明现有防御手段可被系统性绕过,对依赖查询扰动的模型保护方案敲响警钟,推动更鲁棒的防御设计。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Qiyuan Wang, Yao Li, Raymond K. W. Wong

本文提出了一种密度感知的样本特定后门攻击方法(Density-aware Sample-specific Attack),旨在解决现有后门攻击在训练后防御(如微调、剪枝)下容易被擦除的问题。作者重新审视了后门攻击的核心目标,在受害者训练的贝叶斯最优模型下推导出最优样本特定触发器构建的原则性条件。分析表明,当触发样本被引导到干净数据分布的低密度区域时,攻击成功率和干净准确率保持可以同时优化——这种分布条件同时控制了中毒分布的所有矩,而非仅靠输入空间的少数统计量。为此,作者引入了一个双层优化框架,通过条件时间分数匹配估计密度比,并优化混合模型目标函数以将触发样本放置在这些稀疏区域。在MNIST、CIFAR-10、GTSRB和TinyImageNet上的大量实验表明,该方法在防御前达到99%以上的攻击成功率,在微调防御后攻击成功率比最强基线高出50-85个百分点。针对神经元剪枝防御,该方法表现出完全免疫性,在所有剪枝阈值下均未识别出需要移除的神经元。这些结果揭示了当前防御范式的根本性缺陷,强调了需要开发在干净分布支持之外运作的防御机制。对于防御方而言,该研究警示了基于微调和剪枝的现有后门防御存在盲区,后门攻击可以针对数据分布的低密度区域设计触发器,从而绕过这些防御。建议安全从业者关注分布外检测方法,并探索基于密度估计的防御策略。

💡 推荐理由: 揭示了当前主流后门防御(微调、剪枝)的严重盲区:攻击者可通过将触发器置于数据低密度区域完全免疫此类防御。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)