本研究针对SQL注入(SQLi)检测这一Web应用安全中的关键挑战,进行了系统的文献综述以识别研究空白,并据此设计并优化了一个基于DistilBERT的堆叠集成检测管道。该管道首先对数据进行全面的预处理与分词,提取DistilBERT嵌入,然后训练多种机器学习与集成分类器,并在准确率、精确率、召回率和F1分数上进行比较排序。最终选出表现最好的三个模型(逻辑回归、XGBoost和SVM),通过一个神经元元学习器组合成堆叠集成。为了提升鲁棒性,研究者使用快速梯度符号法(FGSM)生成对抗样本对集成模型进行加固,并利用Optuna进行超参数调优。优化后的集成模型在所有报告指标上达到了99.81%的准确率,与最强的单模型(DistilBERT-SVM,99.82%)几乎持平,但在评测平台上,集成模型对完整测试集的分类耗时仅0.0136秒,而DistilBERT-SVM需1.896秒,推理延迟降低了约140倍,同时仍能在单步FGSM攻击下保持99.77%的准确率。研究的主要贡献在于设计和验证了一个以实时速度实现最先进准确率,并对单步FGSM攻击展现出鲁棒性的SQLi检测器,而非仅关注微小的准确率提升。敏感性分析进一步确认了模型的稳定性。这些发现凸显了对抗训练和堆叠元学习在构建稳健的Web应用防火墙(WAF)用于SQLi检测中的价值。为促进开放性验证,数据集、测试集和模型已在GitHub上公开。
💡 推荐理由: 该研究提供了一种兼具高准确率、低延迟和对抗鲁棒性的SQLi检测方案,可直接应用于WAF等实时安全防护场景,有助于蓝队降低误报/漏报并提升响应速度,对强化Web应用安全防御具有实际参考价值。
🎯 建议动作: 研究跟进,评估该模型在自身环境中的适用性并考虑纳入WAF检测流程。