#risk-ranking

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Kyriakos "Rock" Lambros, Steve Wilson

本文针对 OWASP Top 10 for LLM Applications(2026 候选清单)的社区专家排名与实际大规模 LLM 安全事件数据之间的一致性进行了实证检验。作者从 CVE、GHSA、OSV 和 AIAAIC 等来源收集了 7,714 个快照事件,其中 6,639 个事件被标注到包含 20 个类别的分类法上,构建了大规模事件语料库,并利用贝叶斯测量误差模型校正了分类器的精确率和召回率,从而得出基于事件的排名。该候选清单以固定权重(专家投票 0.75、数据 0.25)融合两种信号,使得事件数据能够修正专家共识而不完全推翻它。研究发现,专家排名与数据驱动排名的一致性较弱,Cohen's κ 约为 0.20,且 90% 置信区间跨越零。尽管如此,专家排名依然稳健:对四种前沿分类器进行的预注册对比测试未产生胜出者,且没有任何分类器的表现超过事件发生率基线(平衡准确率 0.863);针对保留的真实标签进行的地面实况检查也保持了基线排序(Spearman ρ=0.918)。该研究是工作组两位成员进行的探索性分析,并非 OWASP 官方发布,也不取代官方列表或流程。

💡 推荐理由: 首次以大规模真实事件数据检验 OWASP LLM Top 10 专家排名的有效性,揭示了专家共识与实证数据之间的偏差,对依赖该清单进行风险评估的安全团队具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)