推荐 9.5
Conf: 50%
本文提出 T-Miner,一种针对深度神经网络 (DNN) 文本分类器 Trojan 攻击的防御框架。Trojan 攻击通过在训练阶段植入后门触发器,使得任何包含该触发器的输入都会被误分类为攻击者指定的目标标签。与图像领域丰富的防御工作相比,文本领域的后门防御研究相对有限。T-Miner 采用序列到序列 (seq2seq) 生成模型,该模型探测可疑分类器并学习生成可能包含 Trojan 触发器的文本序列。其关键创新在于:不需要访问训练数据集或干净输入,而是使用人工合成的“无意义”文本作为初始种子来训练生成模型。随后,T-Miner 分析生成模型输出的文本,判断其中是否包含触发器短语,从而确定分类器是否被植入了后门。实验在 1100 个模型实例上进行,覆盖 3 种主流 DNN 架构(如 LSTM、CNN、BERT 等)、5 种不同的分类任务(如情感分析、垃圾邮件检测等)以及多种触发器短语。结果显示,T-Miner 对 Trojan 模型和干净模型的总体检测准确率达到 98.75%,在干净模型上误报率极低。此外,T-Miner 对针对性的自适应攻击也表现出鲁棒性,能够抵御攻击者刻意绕过检测的尝试。本文的主要贡献在于:提出了首个基于生成模型的无数据文本后门防御方法,并通过大规模实验验证了其有效性和鲁棒性。
💡 推荐理由: 文本分类模型在安全敏感场景(如邮件过滤、内容审核)中广泛应用,但 Trojan 攻击可导致严重误判。T-Miner 不依赖原始训练数据,具有实际部署价值,填补了文本领域后门防御的空白。
🎯 建议动作: 研究跟进,评估方法在自己模型上的适用性
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)