#coreset-selection

共收录 1 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: Qi Zhao, Christian Wressnegger

本文提出一种针对神经网络后门攻击的训练阶段防御方法。现有训练时防御通常从被污染的训练数据中隔离出良性子集,并仅用该子集训练无后门模型。作者将这一策略形式化为核心集选择问题,即“反后门核心集选择”。其核心观察是:有毒样本通常具有较低的预测不确定性,且在数据集中出现频率低于良性样本,因此核心集选择会自然地偏向良性样本。为了进一步放大这一效应,作者提出使用累积熵作为选择准则。累积熵能够跟踪训练样本的学习动态,从而选出信息量高的良性样本。此外,在每个训练轮次中,作者对已选样本进行“遗忘”(unlearning),以增强良性样本与有毒样本之间的可分离性。将这些技术结合,形成了一种有效的训练时防御方法,能构建一个良性核心集并训练出无后门模型。与现有防御相比,本方法在缓解多种后门攻击时保持一致效果,且对自然精度的影响极小。实验表明,该方法在抵御攻击的同时几乎不牺牲模型的正常性能。适合研究后门防御、数据清洗和可信机器学习的学者与安全工程师阅读。

💡 推荐理由: 提供了一种不依赖攻击先验的训练时后门防御新思路,兼顾防御效果与自然精度,对实际部署中的模型安全有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)