本文展示了自然语言处理(NLP)系统容易受到后门攻击,攻击者可以在语言模型中植入隐藏特征(后门),仅当特定触发条件(如特定输入文本)出现时才会被激活,导致模型产生意外行为。作者提出了两种创建隐蔽且自然触发器的文本后门攻击方法,称之为“隐藏后门”。第一种方法基于同形字符替换(homograph replacement),通过视觉上相似的字符替换(例如使用Unicode同形异码字符)来嵌入触发器,这种替换对人类视觉检查具有欺骗性。第二种方法利用语言模型生成的文本与真实自然文本之间的细微差异,生成语法正确、流畅度高的触发句子,使之难以被察觉。作者在三个代表性的安全关键型NLP下游任务上验证了攻击效果:毒性评论检测、神经机器翻译(NMT)和问答(QA)。实验结果显示,在毒性评论检测任务中,仅需注入3%的含触发数据即可达到至少97%的攻击成功率(ASR);在NMT任务中,注入数据少于0.5%即可达到95.1%的ASR;在QA任务中,仅用27个投毒样本(原训练集包含92024个样本,即0.029%)即可实现91.12%的ASR。攻击在保持模型对正常用户功能的同时,使触发器对人类管理员不可见。该研究揭示了现代以人为中心的NLP系统在面对精心设计的后门攻击时的脆弱性。
💡 推荐理由: 该研究揭示了NLP模型极易被植入隐蔽后门,且触发器可绕过人类审查,对部署了毒性检测、机器翻译、问答等NLP系统的安全防御团队构成严重威胁。
🎯 建议动作: 研究跟进