#AI-safety

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Jun Yajima, Tatsuya Oka, Takao Okubo

本文针对自动事实核查系统(Automated Fact-Checking Systems)在社交媒体上用于识别虚假新闻时可能引发的风险进行系统性分类研究。近年来,社交媒体上虚假信息(disinformation)和错误信息(misinformation)的泛滥已成为社会问题,人工事实核查难以覆盖所有帖子,因此自动事实核查系统愈发重要。然而,当前这类系统多依赖人工智能和大语言模型,存在错误判断的风险,且错误结果被发布到社交媒体后可能导致虚假信息进一步扩散或引发诽谤。为了确保自动事实核查系统的安全使用,本文首次提出了一个三阶段风险传播模型:风险因素(risk factors)、危险情境(hazardous situations)和危害(harm)。通过该模型,作者识别出自动事实核查系统中存在的32种具体风险。此外,本文以DEFAME系统为例,将分类后的风险作为分析线索(guide words)进行风险评估,并与传统IT安全风险评估方法STRIDE对比。结果显示,使用本文提出的guide words能够推导出STRIDE方法无法覆盖的风险。该研究为自动事实核查系统的安全设计和风险评估提供了理论框架,适合AI安全研究员、事实核查系统开发者以及社交媒体平台安全团队阅读。

💡 推荐理由: 自动事实核查系统若被攻击或误判,可能加速虚假信息传播,甚至成为诽谤工具。本文首度系统化分类其风险,为AI安全评估提供新维度。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Merkouris Papamichail, Konstantinos Varsos, Giorgos Flouris, João Marques-Silva

该论文聚焦于神经网络鲁棒性认证的可信计算问题。鲁棒性认证旨在为给定输入确定最大扰动范围(轴对齐超矩形),使模型在该范围内预测不变。现有方法追求体积最优认证,但近期的难解性结果证明,在合理时间内计算体积最优认证不可行。为此,作者引入新度量“apothem”(超矩形的最短边距),并提出一种算法,仅需线性次(相对于输入域直径)调用神经网络验证器(Oracle)即可计算apothem最优认证。理论证明表明,即使忽略Oracle计算开销,也不存在基于Oracle的体积最优算法。此外,作者提出“双重认证”(dual certifications),即包含某类所有样本的区间,从而为鲁棒性认证提供基于apothem最小值的上界。实现上,开发了ParallelepipedoNN系统,在MNIST和Fashion-MNIST基准测试上评估。初步实验显示,与现有工作相比,在最小边距指标上至少提升两倍。该工作为解决鲁棒性认证的可计算性与可信度平衡提供了新思路。

💡 推荐理由: 神经网络在安全关键场景中易受对抗样本攻击,鲁棒性认证是评估模型可靠性的重要工具。本工作解决了认证计算效率与最优性的矛盾,提出的apothem度量及线性时间算法使实际部署成为可能,对AI系统安全评估具有理论价值和实践意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Antonio Scala

本文针对AI中介信息操纵问题,提出了一种以社会网络情报(SOCMINT)为核心、基于信息操纵集(IMS)的框架。现有防御方法存在两种极端:一是关注事件级分析,将操纵行为碎片化为弱信号;二是优先归因分析,可能延迟缓解措施。本文提出的IMS框架作为中间操作单元,连接单个事件与战略归因。该框架借鉴VIGINUM/EEAS在反虚假信息分析中使用IMS的经验,将操纵视为连贯过程,涵盖叙事、账号、基础设施、时间模式、跨平台迁移、合成增强和认知目标。流程包括信号检测与诊断分流、IMS假设构建、置信度/严重性评估、缓解措施选择及迭代更新。通过一个紧凑场景说明IMS分析能捕捉内容级和归因优先方法遗漏的信息。论文还提出了桌面推演评估协议,用于评估决策质量、置信度校准和缓解比例性。核心启示是:以人为本的风险缓解不仅需要更好的检测,还需要在不确定性下进行结构化推理、可审计的决策以及防止过度安全化合法异议的保障措施。适合安全分析师、政策制定者及AI风险研究人员阅读。

💡 推荐理由: 该框架提供了介于事件级和归因级之间的实用分析单元,帮助蓝队更早发现信息操纵模式,并在不确定性下做出可审计的缓解决策。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)