推荐 11.6
Conf: 50%
该论文提出并实施了一项大规模系统性研究,旨在利用大语言模型(LLM)检测和分析学术预印本档案中的信息泄露问题。研究背景在于,科研人员在提交预印本(如arXiv、bioRxiv等)时,往往会在匿名化处理后的手稿中残留可识别身份的信息(例如姓名、所属机构、电子邮件地址、基金项目编号或致谢措辞),这些残留信息可能泄露作者身份,破坏双盲评审制度,甚至引发提前披露敏感研究内容的安全风险。传统正则表达式或规则方法难以识别语义层面的间接指认,而LLM具备语义理解和上下文推理能力,能够有效发现复杂的泄露线索。论文核心方法为:收集大规模预印本语料,使用多个LLM(如GPT系列)设计提示词,让模型判断每篇论文是否存在潜在的身份泄露,并输出泄露类型和证据片段;同时设计了一套自动验证流程,通过交叉比对公开元数据来确认泄露的真实性。实验结果表明,该方法能够检测出大量传统方法遗漏的泄露情况,量化了不同学科领域、不同时间段的泄露分布,并揭示了作者匿名化习惯中普遍存在的松懈现象。该研究的主要贡献包括:第一,首次使用LLM对预印本档案进行大规模信息泄露审计;第二,构建了可复现的检测流程和评估基准;第三,提供了针对作者、期刊和档案平台的可操作建议,以降低匿名化失败导致的隐私与学术不端风险。适合学术安全研究者、预印本平台管理人员、期刊编辑以及关注匿名化和隐私保护的安全从业者阅读。
💡 推荐理由: 预印本匿名化失败会导致作者身份泄露,影响学术评审公正性,并可能造成敏感研究提前暴露。本文提出的LLM检测方法为蓝队自动化审计内部文档/匿名数据提供了新思路。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)