#scanner-evaluation

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Qianlong Lan, Vinothini Pandurangan, Anuj Kaul, Indranil Sanyal

本文研究AI模型安全扫描器(特别是针对Pickle和PyTorch等机器学习工件中可执行或不安全内容的静态扫描工具)的评估方法,指出现有常规评估指标(如F1)只关注扫描器能够给出可用安全判断的情况,而忽略了扫描器无法提供判断(即“判断不可用”)的场景。作者构建了一个受控的、基于合成工件的基准测试集,包含170个Pickle和PyTorch相关工件,覆盖145个样本家族,其中135个家族具有二值安全真值标签,另外10个家族为故意构造的畸形样本(无标签)。评估了三款工具:ModelScan、ModelAudit和Fickling,并明确区分了非N/A覆盖率、分析完成度、确定性安全决策、非安全发现和不支持结果等不同情形。实验结果显示:在有标签的家族上,ModelAudit对所有135个家族(100%)给出了确定性安全决策,Fickling对110个家族(81.5%),而ModelScan仅对67个家族(49.6%)。在能够做出确定性判断的前提下,ModelScan的精确率、召回率和F1均为100%。Fickling没有发现任何超出ModelAudit和ModelScan组合能发现的独特真阳性家族。此外,在ModelScan未能完成分析的48个恶意家族中,ModelAudit和Fickling都产生了与真值一致的检测结果。这些发现强调了在评估扫描器时,需要将判断准确性与判断可用性区分开,同时也要区分增量检测覆盖率和工具之间的冗余。本文的核心贡献在于提出了一套更细粒度的评估框架,并揭示了仅依赖F1等传统指标可能高估或低估工具实际效能的陷阱。适合研究机器学习供应链安全、静态分析工具评估以及AI安全检测技术的安全研究人员和工程师阅读。

💡 推荐理由: 现有安全扫描器评估多依赖F1等指标,但忽略了扫描器无法给出判断时的覆盖率问题。本文通过实证揭示了工具间显著的能力差距与冗余,为蓝队选择、部署和组合AI工件扫描工具提供了量化依据,避免因指标误导而遗漏恶意内容。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)