该论文研究了分类模型中的反蒸馏采样问题。知识蒸馏攻击中,攻击者通过查询目标分类器的预测接口,利用返回的概率向量训练一个替代模型,从而窃取模型功能。此前针对大语言模型提出的反蒸馏采样方法通过输入相关的梯度导向扰动来防御此类攻击,但该方法在分类任务中的迁移尚未被研究。本文首先将反蒸馏采样迁移至分类场景,并发现其行为由教师模型每个输入上的置信度边际分布决定。由于训练良好的分类器存在严重的过度自信现象,直接迁移会导致一个“惰性窗口”:当扰动低于某个可闭式预测的阈值时,既不阻碍攻击者也不保护防御者;超过阈值后,防御发生相变,对教师模型的退化速度快于攻击者的学生模型。温度软化可以在闭式上缩放该相变点,但所有温度配置都位于相同的不利权衡曲线上。为此,作者提出ADS-C方法,在闭式每个输入边际预算下组合扰动,该预算可证明保留每个服务的top-1预测,因此防御后的教师准确度与未防御教师完全一致。在该保证下,蒸馏学生模型在CIFAR-100上仍损失17.4个百分点,CIFAR-10上损失29.6个百分点,Tiny-ImageNet上损失13.3个百分点;而使用未经修改的防御达到相同的学生退化程度则需要牺牲教师27.5、32.9和22.2个百分点的准确度。由于服务标签不变,硬标签攻击者无法获益,而防御后的软输出训练的学生模型准确度甚至低于硬标签底线(最多低29.7个百分点):蒸馏服务概率的动机不仅被消除,反而被逆转。据作者所知,ADS-C是第一个效用成本恰好为零的分类反蒸馏防御方法。
💡 推荐理由: 提出首个零效用损失的反蒸馏防御,有效防止攻击者通过概率查询复制分类器,同时不牺牲原始模型准确度,对保护商业或敏感分类模型具有重要意义。
🎯 建议动作: 研究跟进