#cross-corpus

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Sadib Hassan Rumman, Md. Shariful Islam, Md. Rayhanur Rahman

本文针对物联网固件漏洞检测中的跨语料库泛化问题展开研究。当前领域面临固件生态异构、平台资源受限以及现有基准测试局限性等挑战,许多数据集为合成数据或通用数据,缺乏人工验证和污染筛查,导致模型跨语料库泛化能力缺少可靠证据。为填补这一空白,作者提出了 IoTVulBench,一个经过人工验证的跨语料库固件漏洞检测基准。IoTVulBench-Core 从 GitHub 仓库构建,由三位专家评审员验证,并在经过污染筛查的held-out目标集上,评估了五种模型架构、两种调优方法和三种课程学习策略,同时进行了集成、蒸馏和鲁棒性分析。实验结果显示,在匹配的单源数据集中,基于 IoTVulBench 训练的模型取得了最高 MCC 值,达到 0.58,优于 PrimeVul 的 0.44 和 D2A 的 0.39。采用分阶段课程学习可将 MCC 提升至 0.69,而多样性优化的集成模型达到 0.73,比最强的参考比较器(静态分析器,MCC 0.31)高出 0.42,比 PrimeVul 高出 0.29。在 0.5% 假阳性率下,模型仅漏报 21% 的漏洞,而最强比较器漏报 71%。该模型在标识符重命名下保留了 86% 的性能,并展现出良好的校准性和可解释性。这些发现表明,领域匹配的训练数据和课程设计,而非单纯的模型规模,是固件漏洞检测泛化能力的关键驱动因素。本文为未来研究提供了基准,并为实际 IoT 安全应用提供了可部署的配置。适合安全研究人员、固件安全工程师和 LLM 应用开发者阅读。

💡 推荐理由: 该研究为物联网固件漏洞检测提供了首个经过人工验证和污染筛查的基准,并证明了领域匹配数据和课程学习比模型规模更重要,有助于提升固件安全分析的可靠性和部署效果。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)