#cybersecurity-benchmark

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Shubham Malaviya, Manish Shukla 0001, Saurabh Anand, Sachin Lodha

本文指出网络安全机器学习基准数据集中普遍存在的标签错误问题,并以威胁情报(CTI)领域为例,构建了改进版数据集 D-LADDER++(基于公开的 LADDER 数据集经人工修正标签错误后得到)。作者使用开源模型 Microsoft Phi-3 和闭源模型 Google Gemini 在 D-LADDER++ 上进行了零样本和少样本评估,并对 Phi-3 进行了微调以提升适配性。实验结果表明,测试集中的标签错误会显著影响模型性能评估,进而误导模型选择。研究强调了构建高质量、无标签错误的网络安全基准数据集的重要性,以确保机器学习模型的可靠评估和实际部署。

💡 推荐理由: 标签错误在网络安全基准中普遍被忽视,但会严重扭曲模型性能评估,导致选型失当和部署风险。本文系统性地修正了现有数据集并量化了影响,为后续研究提供了更可靠的评测基础。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Edward Raff, Maor Ashkenazi, Sagar Samtani, David J. Elkind, Sven Krasser

本文提出,网络安全领域是检验生成式AI(特别是基于大语言模型的代理系统)成功与否的真正前沿。作者指出,网络安全工作流需要协调数百种标准及定制工具,处理格式多样的数据,且数据规模巨大(例如单个恶意软件样本可视为数十亿token的序列)。标签成本高昂且劳动密集,因为攻击者(可能包括国家资助的行为体)刻意规避检测方法,即使是专家也可能对正确标签存在分歧。部署时,模型需在持续变化的环境中每天处理数十亿项,且低延迟对运营成功至关重要。此外,可解释性不可或缺:分析师需要清晰的推理来应对日常大量误报,并快速制定修复方案。作者认为,网络安全在复杂性上超越了自然语言处理和计算机视觉,因此是衡量通用AI进展更好的测试案例。本文主要贡献在于论证网络安全对AI系统的独特挑战,并呼吁更多研究关注该领域。适合AI安全研究者、安全运营从业者及大语言模型应用开发者阅读。

💡 推荐理由: 本文揭示了网络安全作为AI应用场景的极端复杂性,挑战了当前主流以NLP/CV为基准的AI评估体系,为生成式AI在真实高风险环境中的落地提供了关键视角。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)