#scientific-fraud

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Bálint Gyevnár, Atoosa Kasirzadeh, Nihar B. Shah

本论文探讨了一种新型的科学欺诈攻击方式——间接数据投毒(Indirect Data Poisoning)。随着人工智能在科学研究中的广泛应用,自主研究代理(autonomous research agents)能够自动检索和处理公开数据集。攻击者通过向开放数据集注入精心篡改的版本,并上传到公共仓库,使得这些代理在不经意间将虚假数据传播给诚实的研究者,从而大规模地工业化科学欺诈。研究者在五个社会敏感主题(如招聘歧视、自动驾驶汽车安全等)上,使用三种前沿AI系统(Claude Code with Claude Opus 4.7、Codex with GPT-5.5、Gemini CLI with Gemini 3.1 Pro)进行了450次符合伦理的实验。结果显示,投毒攻击在49.56%的实验中成功,而检测率仅为6.0%。攻击不需要特定主题的触发词、代理访问、间接提示注入或伪造论文,仅依赖开放数据生态系统和误导性元数据。为缓解攻击,研究者提出了两种措施:科学家角色(scientist persona)和数据来源审计(data provenance audit),后者包括五项检查(参考文献、社交标记、统计异常、相关数据集、投毒警告)。结果表明,科学家角色仍导致16.67%的实验得出被投毒的结论,而数据来源审计将攻击成功率降至零。论文结论指出,间接数据投毒可能以前所未有的规模实现科学欺诈,但通过代理在数据检索过程中的适当审计可以有效缓解。

💡 推荐理由: 本文揭示了一种新型AI安全威胁:通过操控公开数据集,攻击者可远程破坏科学研究的完整性,且检测极为困难。对使用AI辅助研究的机构和个人具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)