该论文针对钓鱼邮件检测中机器学习模型的对抗鲁棒性进行了系统性比较研究。作者指出,目前大多数检测准确率报告仅基于干净、分布内测试数据,而未考虑攻击者可能故意篡改邮件以逃避检测。为此,论文选取了两个代表性方法:传统的TF-IDF + 逻辑回归基线模型,以及基于微调DistilBERT的Transformer模型。两者在六个公开数据集合并的82255封邮件统一语料库上训练,并在三种条件下评估:正常分布内测试、合成钓鱼测试和对抗钓鱼测试(使用对抗性扰动)。实验结果显示,两个模型在干净数据上均超过98%准确率,但对抗测试下急剧下降:TF-IDF+LR降至64.00%(下降34.59个百分点),DistilBERT降至63.64%(下降35.40个百分点),两者差距仅0.36个百分点,相当于对抗测试集275个样本中一个邮件的差异。使用LIME、SHAP和注意力展开分析表明,两种模型依赖不同的证据但呈现相似的脆弱性。成对错误分析显示,模型在54.9%的对抗样本上同时出错,但各自也有相近数量的独有错误(分别为24和25个),说明失败模式部分互补而非完全一致。研究结果强调了干净数据准确率无法预测对抗鲁棒性,并建议将对抗测试作为钓鱼邮件检测评估的标准部分。
💡 推荐理由: 揭示了当前钓鱼邮件检测模型在对抗攻击下的脆弱性,证明高准确率不等于高鲁棒性,对蓝队评估和部署检测系统有直接警示意义。
🎯 建议动作: 研究跟进