#model safety

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Ana-Maria Cretu 0002, Klim Kireev, Amro Abdalla, Wisdom Obinna, Raphael Meier, Sarah Adel Bargal, Elissa M. Redmiles, Carmela Troncoso

本文评估了从文生图模型(如扩散模型)的训练数据中过滤儿童图像以阻止模型被滥用于生成儿童性虐待材料(CSAM)的有效性。首先,作者通过基于游戏的安全定义捕捉了防止CSAM生成的复杂性,指出过滤防御需平衡攻击者能力和模型实用性。其次,实证表明现有检测方法(如基于感知哈希或分类器)无法从数据集中完全移除所有儿童图像,存在漏网之鱼。第三,以“戴眼镜的儿童”作为CSAM的伦理代理,实验发现即使训练数据中仅残留少量儿童图像(过滤后),攻击者仍可通过特定提示策略(如重复采样或组合概念)以略多于未过滤模型的查询次数生成戴眼镜的儿童。若对过滤后的模型进行微调(使用少量儿童图像),额外查询开销进一步降低。此外,即使过滤完美(训练数据中无儿童图像),攻击者仍可通过微调(例如使用少量外部儿童图像)重新引入生成儿童概念的能力。结果表明,当前儿童过滤方法对闭源模型提供有限保护,对开源模型则完全无效,且过滤会损害模型通用性(如削弱儿童相关概念生成或改变其语义表示)。最后,作者指出了评估概念过滤防御对CSAM影响时面临的挑战,包括缺乏真实CSAM数据、伦理约束及可迁移性等问题。本文适合从事AIGC安全、内容审核、模型鲁棒性研究的学者及平台安全策略制定者阅读。

💡 推荐理由: 揭示了当前基于数据过滤的CSAM防护存在根本性缺陷,攻击者可通过少量残留样本或微调绕过防御,对开源模型尤其危险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)