#knowledge-distillation

共收录 3 条相关安全情报。

← 返回所有主题
推荐 10.5
Conf: 50%
👥 作者: Khawaja Abaid Ullah, Mohammad Javad Khojasteh

该论文研究了分类模型中的反蒸馏采样问题。知识蒸馏攻击中,攻击者通过查询目标分类器的预测接口,利用返回的概率向量训练一个替代模型,从而窃取模型功能。此前针对大语言模型提出的反蒸馏采样方法通过输入相关的梯度导向扰动来防御此类攻击,但该方法在分类任务中的迁移尚未被研究。本文首先将反蒸馏采样迁移至分类场景,并发现其行为由教师模型每个输入上的置信度边际分布决定。由于训练良好的分类器存在严重的过度自信现象,直接迁移会导致一个“惰性窗口”:当扰动低于某个可闭式预测的阈值时,既不阻碍攻击者也不保护防御者;超过阈值后,防御发生相变,对教师模型的退化速度快于攻击者的学生模型。温度软化可以在闭式上缩放该相变点,但所有温度配置都位于相同的不利权衡曲线上。为此,作者提出ADS-C方法,在闭式每个输入边际预算下组合扰动,该预算可证明保留每个服务的top-1预测,因此防御后的教师准确度与未防御教师完全一致。在该保证下,蒸馏学生模型在CIFAR-100上仍损失17.4个百分点,CIFAR-10上损失29.6个百分点,Tiny-ImageNet上损失13.3个百分点;而使用未经修改的防御达到相同的学生退化程度则需要牺牲教师27.5、32.9和22.2个百分点的准确度。由于服务标签不变,硬标签攻击者无法获益,而防御后的软输出训练的学生模型准确度甚至低于硬标签底线(最多低29.7个百分点):蒸馏服务概率的动机不仅被消除,反而被逆转。据作者所知,ADS-C是第一个效用成本恰好为零的分类反蒸馏防御方法。

💡 推荐理由: 提出首个零效用损失的反蒸馏防御,有效防止攻击者通过概率查询复制分类器,同时不牺牲原始模型准确度,对保护商业或敏感分类模型具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md. Nahid Hasan, Md. Golam Rabiul Alam

该论文针对物联网设备面临的僵尸网络攻击(如DDoS、数据窃取等)提出了一种轻量级、强化学习驱动的框架DiRLU。现有AI方案存在两大局限:模型过重难以部署于IoT设备,且缺乏“遗忘”能力(即无法在不重新训练的情况下移除敏感或过时特征)。DiRLU通过知识蒸馏将教师模型的知识迁移至轻量级学生模型,两者均使用A2C(优势演员-评论家)强化学习算法训练。框架核心创新在于后置遗忘机制:可选择性修改模型权重以遗忘目标特征,同时保留其他能力,且被恢复的特征性能损失极小,证明遗忘是可逆的。实验采用BoT-IoT数据集的25%(远超通常的5%),教师模型更稳健;学生模型达到99.60%准确率和99.80% F1分数。此外,集成LIME可解释性技术增强透明度。DiRLU仅需2370 FLOPS,比现有最优模型高效约3.87倍,适合边缘部署。该框架符合GDPR“被遗忘权”要求,为IoT安全提供实用且可扩展的解决方案。

💡 推荐理由: 提出了一种融合强化学习、知识蒸馏与隐私保护遗忘的轻量级IoT安全方案,在保持高精度的同时支持合规性(GDPR),对资源受限的IoT设备部署具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yilan Gao, Sida Huang, Hongyuan Zhang, Xuelong Li

本文针对文本到图像生成模型(如 Stable Diffusion)在作为云端 API 服务部署时面临的模型窃取攻击展开研究。攻击者可以通过反复查询 API 收集大量生成的合成图像,并用这些图像训练私有替代模型,从而实现未经授权的知识蒸馏和能力复制,而无需访问原始模型权重。现有防御方法难以在保持输出图像视觉质量、提供显式扰动幅度控制以及高效处理大规模输出之间取得平衡。为此,作者提出了一种基于单次生成器(single-pass)的保护框架 WaveGuard。WaveGuard 采用频率感知的扰动生成器,在用户指定的扰动预算下对每张合成图像注入结构化、不可感知的扰动。这些扰动对于正常观看者几乎不可见,但能显著降低受保护图像作为训练数据对未授权学生模型的有效性。在 WikiArt 数据集上的合成输出蒸馏实验表明,WaveGuard 在有效性、保真度和效率三者之间取得了良好权衡,实现了显式的不可感知性控制,并大幅提升了保护效率。该方法不需要修改原始生成模型,仅需在输出图像上叠加扰动,可无缝集成到现有 API 管道中。

💡 推荐理由: 随着生成式AI服务商业化,模型窃取成为重大安全威胁。本文提出一种实用、高效的防御方案,在不影响用户体验的前提下干扰攻击者训练替代模型,对保护商业模型知识产权具有直接价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)