该论文提出了一种以'被击败的缓解措施'为组织维度的基准污染(benchmark contamination)分类法,旨在解决当前排行榜分数中模型能力与数据泄漏在观测上难以区分的问题。作者指出现有污染分类法主要用于自动化检测,但未能回答发布者在面对已应用缓解措施时仍存在的有效性威胁。论文定义了五种污染类型:直接(direct)、衍生(derivative)、时间(temporal)、分布(distributional)和获得性(acquired),涵盖训练时和评估时的泄漏。其中,前四种分别对应不同的缓解措施失效场景,而第五种'获得性污染'是评估过程中产生的,属于单次运行的性质,因此必须与报告的分数一同记录,而非随基准发布。作者进一步操作化为一个四字段披露协议,允许'未知'为有效条目,并发布了遵循CC BY 4.0许可的JSON Schema、验证器及工作示例。为了检验该分类法的可用性,两位外部编码者使用预先注册的工具对41篇文档进行了分析。结果显示,在29篇主通道文档上,各变量的线性加权κ值从0.00到0.35(中位数0.21),而单编码测试-重测上限为0.84,说明信度受类别不平衡影响而偏低;合并后通过机会校正升至0.46,但并非因一致性提高。两个变量(分层报告和本文引入的获得性类型)低于预先注册的流行度稳健阈值,分歧主要集中在变量是否适用,而非文档陈述内容。文档中仅13%报告了引导预算(elicitation budget),且没有文档覆盖全部五种类型。论文的贡献包括:该分类法、由此衍生的分数侧工件,以及对工具可靠性和当前披露状况的预先注册测量。该研究适合AI评估设计者、模型审计人员以及关注基准可信度的研究者和从业者阅读。
💡 推荐理由: 该研究揭示了当前AI基准污染分类的盲区,提出更全面的污染类型和披露协议,有助于安全从业者更准确地评估LLM能力与潜在数据泄漏风险,避免被虚荣指标误导。
🎯 建议动作: 研究跟进