#citation-verification

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Patrik Reizinger, Wieland Brendel

大型语言模型(LLM)在学术写作中越来越普遍,但其生成的文献综述常包含虚构引用(幻觉引用)。GPTZero 发现 NeurIPS 2025 被接受的论文中有 53 篇存在此类问题。现有的基于规则和 LLM 的验证器缺乏统一的基准测试和详细的失败诊断。为弥补这一空白,本文提出了 HALLMARK(幻觉基准测试),包含 2,526 条 BibTeX 条目,覆盖 14 种幻觉类型、3 个难度等级、每条条目 6 个诊断子测试,以及一个抗污染的主保留集。在此基准上,作者评估了 DOI 查询基线、零样本前沿 LLM、工具增强型代理,以及他们自己设计的基于规则的验证器 bibtex-updater。跨基准测试的一致结果是:决定验证器可部署性的关键因素是假阳性率(FPR)而非召回率。HALLMARK 通过三种失败模式具体化了这一发现:代理查找提高了召回率但增加了假阳性率;在现实发生率下,假阳性率的数量级差异(而非召回率)决定了验证器的标记结果主要是真实命中还是噪音;大多数 LLM 会过度标记其训练截止日期之后发表的论文,只有两个最新截止日期的模型能将假阳性率维持在接近分布内的水平(该信号仅作描述性报告,因为它可能与这些条目的召回情况混杂)。因此,假阳性率是部署瓶颈,但对科学记录而言,未被检测到的虚构引用仍然是代价更高的错误。

💡 推荐理由: 随着 LLM 在学术写作中广泛应用,其产生的幻觉引用可能污染科学文献。本文揭示了验证器部署的关键瓶颈是假阳性率而非召回率,为安全从业者评估和选择引用验证工具提供了重要参考。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)