#text-classification

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Ana Schwengber Kelm, Christian Bockermann, Jörg Frochte

本文研究将通用漏洞披露(CVE)记录自动映射到通用弱点枚举(CWE)类别的文本分类方法。CVE-to-CWE映射是漏洞分析中的关键步骤,但目前主要依赖人工。作者将该任务建模为文本分类问题,比较了两种建模策略:多类分类(每个CVE预测一个CWE)和多标签分类(允许预测多个CWE)。实验采用了三种Transformer编码器(BERT Base、SecureBERT和CySecBERT),并在三个嵌套的标签空间(83、47和25个CWE类别)上进行评估。结果表明,多类训练在所有设置下均取得更高的宏F1分数,但随着标签空间缩小,与多标签的差距从21个百分点缩小到2个百分点。在多标签设置中,通过后处理阈值优化可在25类设置下缩小差距。混淆分析显示,主要的错误分类模式遵循CWE层次结构,且三个编码器的错误模式高度相似(Pearson相关系数r > 0.92),表明错误结构更多由分类法设计而非编码器选择驱动。层次宽松评估(允许家族内混淆)将宏F1从约81%提升至约90%,表明严格指标低估了分支级分类器质量。总体而言,CySecBERT在多标签设置中表现最佳,具有统计显著性。该研究为自动化CVE-to-CWE映射提供了方法论指导,并揭示了分类法结构对分类性能的影响。

💡 推荐理由: CVE-to-CWE映射是漏洞管理的基础,自动化可显著降低人工成本。本文揭示了分类法结构对映射错误的主导影响,对开发更鲁棒的自动映射工具具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ahmadreza Azizi, Ibrahim Asadullah Tahmid, Asim Waheed, Neal Mangaokar, Jiameng Pu, Mobin Javed, Chandan K. Reddy, Bimal Viswanath

本文提出 T-Miner,一种针对深度神经网络 (DNN) 文本分类器 Trojan 攻击的防御框架。Trojan 攻击通过在训练阶段植入后门触发器,使得任何包含该触发器的输入都会被误分类为攻击者指定的目标标签。与图像领域丰富的防御工作相比,文本领域的后门防御研究相对有限。T-Miner 采用序列到序列 (seq2seq) 生成模型,该模型探测可疑分类器并学习生成可能包含 Trojan 触发器的文本序列。其关键创新在于:不需要访问训练数据集或干净输入,而是使用人工合成的“无意义”文本作为初始种子来训练生成模型。随后,T-Miner 分析生成模型输出的文本,判断其中是否包含触发器短语,从而确定分类器是否被植入了后门。实验在 1100 个模型实例上进行,覆盖 3 种主流 DNN 架构(如 LSTM、CNN、BERT 等)、5 种不同的分类任务(如情感分析、垃圾邮件检测等)以及多种触发器短语。结果显示,T-Miner 对 Trojan 模型和干净模型的总体检测准确率达到 98.75%,在干净模型上误报率极低。此外,T-Miner 对针对性的自适应攻击也表现出鲁棒性,能够抵御攻击者刻意绕过检测的尝试。本文的主要贡献在于:提出了首个基于生成模型的无数据文本后门防御方法,并通过大规模实验验证了其有效性和鲁棒性。

💡 推荐理由: 文本分类模型在安全敏感场景(如邮件过滤、内容审核)中广泛应用,但 Trojan 攻击可导致严重误判。T-Miner 不依赖原始训练数据,具有实际部署价值,填补了文本领域后门防御的空白。

🎯 建议动作: 研究跟进,评估方法在自己模型上的适用性

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)