#citation-audit

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Pengyin Shan

该论文针对研究软件项目元数据一致性问题展开系统审计。研究软件项目往往在多个位置同时描述自身,例如仓库中的引用文件(如 CITATION.cff)、归档存储、DOI 注册记录、包注册表以及 README 文本等。作者将这些机器可读的自描述视为软件的多个‘表面’,而不同的引用指南、索引服务和自动化代理可能读取不同的表面子集,因此表面之间的分歧会导致引用归属和来源追溯的碎片化。论文提出一个此前未被直接量化的问题:当项目自身的元数据表面相互比较时,一致程度如何?作者构建了包含 117 个开源研究软件项目的审计语料,其中包括 87 个高性能计算与量子计算项目,以及 30 个来自 JOSS 和 pyOpenSci 已接收软件列表的注册基线项目,每个项目最多评估七个机器可读表面。他们设计了一个四级判定规则,覆盖六个元数据字段,并在 338 行分层样本上实现了 98.5% 的人工验证判定准确率。结果表明,在至少暴露两个可比较表面的 62 个项目中,有 52 个(83.9%)存在至少一个核心字段冲突,且该结果对模糊匹配阈值不敏感。一半的人工裁决跨表面冲突可归因于单一机制:表面描述的是软件对应的论文而非软件本身。在包含首选引用的 CITATION.cff 项目中,32 个中有 28 个将引用指向与软件自身元数据不一致的记录。作者列表和标题的不一致最为严重,注册表表面的一致性最差。论文还发布了审计流水线库、语料库、注册抽样协议、原始快照和完整验证日志。该研究为软件引用元数据的可靠性提供了首个大规模量化证据,对学术引用、软件索引和自动化代理的可信度具有重要参考价值。适合研究软件工程、数字图书馆、引用分析和元数据治理的从业者阅读。

💡 推荐理由: 该研究首次系统量化了研究软件多源元数据冲突问题,直接影响引用归属、学术信誉和自动化工具的数据可信度。安全团队在依赖软件供应链元数据时需警惕此类不一致性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)