#risk-taxonomy

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Maria Mahbub, Steven Young, Amir Sadovnik, Edmon Begoli, Chris Rugenstein, Donald Coulter, Anthony Ayodele

本文针对AI系统在安全、金融、医疗等领域广泛部署后所面临的模型逃逸攻击问题,指出传统基于攻击者知识(白盒、灰盒、黑盒)的分类方法忽视了不同部署接口实际暴露信息信号(如仅输出最终决策、置信分数、中间表示或完整参数)对攻击能力的影响。作者提出了基于信号驱动的模型访问风险分类框架(SMART),该框架以部署场景为导向,根据AI系统返回信息信号的类型与丰富程度(从有限到充分)对攻击者访问级别进行精细化划分。在此框架下,文章系统梳理了从最低信息暴露(仅观察硬分类输出)到最高暴露(完全白盒)各层级上逃逸攻击的策略演变,分析了各层级下攻击者所能实现的能力边界(如扰动幅度、成功率、迁移性等)。该工作旨在帮助安全工程师、AI系统采购方和运营方理解不同部署配置所引入的实际风险,从而做出更安全的模型部署与第三方模型采购决策。本文属于概念性研究论文,尚未提供具体攻击实验或检测方法验证。

💡 推荐理由: 为AI系统运营安全提供了更贴合实际部署场景的风险分析视角,帮助安全从业者理解不同输出信号暴露下攻击能力的差异,从而针对性设计防御与控制措施。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jun Yajima, Tatsuya Oka, Takao Okubo

本文针对自动事实核查系统(Automated Fact-Checking Systems)在社交媒体上用于识别虚假新闻时可能引发的风险进行系统性分类研究。近年来,社交媒体上虚假信息(disinformation)和错误信息(misinformation)的泛滥已成为社会问题,人工事实核查难以覆盖所有帖子,因此自动事实核查系统愈发重要。然而,当前这类系统多依赖人工智能和大语言模型,存在错误判断的风险,且错误结果被发布到社交媒体后可能导致虚假信息进一步扩散或引发诽谤。为了确保自动事实核查系统的安全使用,本文首次提出了一个三阶段风险传播模型:风险因素(risk factors)、危险情境(hazardous situations)和危害(harm)。通过该模型,作者识别出自动事实核查系统中存在的32种具体风险。此外,本文以DEFAME系统为例,将分类后的风险作为分析线索(guide words)进行风险评估,并与传统IT安全风险评估方法STRIDE对比。结果显示,使用本文提出的guide words能够推导出STRIDE方法无法覆盖的风险。该研究为自动事实核查系统的安全设计和风险评估提供了理论框架,适合AI安全研究员、事实核查系统开发者以及社交媒体平台安全团队阅读。

💡 推荐理由: 自动事实核查系统若被攻击或误判,可能加速虚假信息传播,甚至成为诽谤工具。本文首度系统化分类其风险,为AI安全评估提供新维度。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)