#contamination

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Johanna Angulo, Víctor Yeste, Hector Espinos-Morato

该论文提出了一种以'被击败的缓解措施'为组织维度的基准污染(benchmark contamination)分类法,旨在解决当前排行榜分数中模型能力与数据泄漏在观测上难以区分的问题。作者指出现有污染分类法主要用于自动化检测,但未能回答发布者在面对已应用缓解措施时仍存在的有效性威胁。论文定义了五种污染类型:直接(direct)、衍生(derivative)、时间(temporal)、分布(distributional)和获得性(acquired),涵盖训练时和评估时的泄漏。其中,前四种分别对应不同的缓解措施失效场景,而第五种'获得性污染'是评估过程中产生的,属于单次运行的性质,因此必须与报告的分数一同记录,而非随基准发布。作者进一步操作化为一个四字段披露协议,允许'未知'为有效条目,并发布了遵循CC BY 4.0许可的JSON Schema、验证器及工作示例。为了检验该分类法的可用性,两位外部编码者使用预先注册的工具对41篇文档进行了分析。结果显示,在29篇主通道文档上,各变量的线性加权κ值从0.00到0.35(中位数0.21),而单编码测试-重测上限为0.84,说明信度受类别不平衡影响而偏低;合并后通过机会校正升至0.46,但并非因一致性提高。两个变量(分层报告和本文引入的获得性类型)低于预先注册的流行度稳健阈值,分歧主要集中在变量是否适用,而非文档陈述内容。文档中仅13%报告了引导预算(elicitation budget),且没有文档覆盖全部五种类型。论文的贡献包括:该分类法、由此衍生的分数侧工件,以及对工具可靠性和当前披露状况的预先注册测量。该研究适合AI评估设计者、模型审计人员以及关注基准可信度的研究者和从业者阅读。

💡 推荐理由: 该研究揭示了当前AI基准污染分类的盲区,提出更全面的污染类型和披露协议,有助于安全从业者更准确地评估LLM能力与潜在数据泄漏风险,避免被虚荣指标误导。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yongjie Wang, Xinyue Zhang, Kunhong Yao, Zhiwei Zeng, Kaisong Song, Jun Lin, Zhiqi Shen

本文系统研究了深度研究Agent在公共基准评测中因推理时进行网络搜索而引发的“搜索时污染”(Search-Time Contamination, STC)问题。STC是指Agent在回答问题时,通过Web搜索检索到基准测试的元数据、问题上下文甚至真实答案,从而绕过预期推理过程,导致评测得分虚高。作者定义了三种严重程度递增的污染类型:基准元数据泄漏(Benchmark Metadata Leakage)、问题上下文泄漏(Question-Context Leakage)和显式答案泄漏(Explicit Answer Leakage),并设计了检测算法来识别这些污染并量化其对性能的影响。实验在六个公共基准上评估了现代深度研究Agent,发现STC普遍存在,可导致性能膨胀高达4%。研究结果表明,现有评测可能高估了Agent的真实推理能力。为此,作者倡导采用污染感知的评测实践,包括隔离沙盒、透明的搜索轨迹以及受控的基准访问。本文对于理解LLM Agent能力评估的可靠性具有重要意义,适合AI安全评测、基准设计及Agent开发者阅读。

💡 推荐理由: 该研究揭示了深度研究Agent评测中的严重漏洞,即搜索污染可能导致性能虚高,误导社区对模型真实能力的判断,对LLM能力评估和AI安全评测方法具有重要警示作用。

🎯 建议动作: 关注污染物检测算法并改进内部Agent评测流程,采用隔离沙盒和透明搜索轨迹。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.5
Conf: 50%
👥 作者: Ali Al-Lawati, Jason Lucas, Dongwon Lee, Suhang Wang

本文探讨了大型语言模型(LLM)基准数据集被预训练语料库污染的问题。污染导致基准数据集无法可靠衡量模型的泛化能力。作者提出基准数据集应具有“抗污染”特性,即数据集对训练不可学习(unlearnable),但支持推理(inference)。为实现这一目标,论文首先强调了基准数据集污染的普遍性,并勾勒了抗污染数据集应具备的属性。其次,作者指出Transformer架构中推理与训练流程的非对称性可被利用来支持抗污染。第三,概述了使这些数据集在不同LLM架构间互操作所需数学进展。最后,呼吁社区通过推进新型抗污染方法、开发支持性方法与平台、以及将抗污染基准纳入现有评估流程来确保LLM评估的可靠性。本文适合LLM研究者、评估工具开发者及关注模型安全性的从业人员阅读。

💡 推荐理由: LLM基准污染直接威胁模型评估的可信度,进而影响安全场景中LLM的能力验证与风险控制。提出抗污染基准有助于构建更可靠的安全评估体系。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)