推荐 5.5
Conf: 50%
本文针对自动事实核查系统(Automated Fact-Checking Systems)在社交媒体上用于识别虚假新闻时可能引发的风险进行系统性分类研究。近年来,社交媒体上虚假信息(disinformation)和错误信息(misinformation)的泛滥已成为社会问题,人工事实核查难以覆盖所有帖子,因此自动事实核查系统愈发重要。然而,当前这类系统多依赖人工智能和大语言模型,存在错误判断的风险,且错误结果被发布到社交媒体后可能导致虚假信息进一步扩散或引发诽谤。为了确保自动事实核查系统的安全使用,本文首次提出了一个三阶段风险传播模型:风险因素(risk factors)、危险情境(hazardous situations)和危害(harm)。通过该模型,作者识别出自动事实核查系统中存在的32种具体风险。此外,本文以DEFAME系统为例,将分类后的风险作为分析线索(guide words)进行风险评估,并与传统IT安全风险评估方法STRIDE对比。结果显示,使用本文提出的guide words能够推导出STRIDE方法无法覆盖的风险。该研究为自动事实核查系统的安全设计和风险评估提供了理论框架,适合AI安全研究员、事实核查系统开发者以及社交媒体平台安全团队阅读。
💡 推荐理由: 自动事实核查系统若被攻击或误判,可能加速虚假信息传播,甚至成为诽谤工具。本文首度系统化分类其风险,为AI安全评估提供新维度。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)