#citation-verification

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Patrik Reizinger, Wieland Brendel

本文介绍 HALLMARK,一个用于诊断大语言模型(LLM)引文验证器故障模式的基准测试。研究背景是:LLM 已广泛用于撰写文献综述和学术写作,导致虚构引用(幻觉)风险增加。例如,GPTZero 在 NeurIPS 2025 接收论文中发现 53 篇存在幻觉引用。现有基于规则和 LLM 的验证器正在涌现,但缺乏统一的基准来比较它们并提供详细的故障诊断。为此,作者构建了 HALLMARK,包含 2,526 条 BibTeX 条目,覆盖 14 种幻觉类型、三个难度等级,每个条目有六个诊断子测试,并设有抗污染的分割集。在该基准上,作者评估了 DOI 查找基线、零样本前沿 LLM、工具增强代理以及作者自己设计的基于规则的协同验证器 bibtex-updater。基准测试的一致结果是:假阳性率(而非召回率)决定了验证器是否可部署。通过三个故障模式具体说明:1) 代理式查找提高了召回率但导致假阳性激增;2) 在现实发生的基率下,假阳性率数量级的差异(而非召回率)决定了验证器标记的结果是真正的命中还是噪声;3) 大多数 LLM 对其训练截止日期之后发表的论文过度标记,只有两个最新截止日期的模型能将假阳性率保持在接近分布内水平(作者仅描述这一现象,因为其与对这些条目的可能召回相混淆)。因此,假阳性率是部署瓶颈,但对于科学记录而言,未检测到的虚构仍然是代价更高的错误。本文主要贡献是提出了一个标准化基准,系统揭示了验证器的关键失效模式,适合研究 LLM 可靠性、学术诚信检测以及工具增强 NLP 系统的研究者阅读。

💡 推荐理由: 该基准首次系统量化了 LLM 引文验证器的假阳性率问题,指出当前方法可部署性瓶颈在于假阳性而非召回率,对学术打假和 LLM 安全应用具有直接指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)