#hate-speech

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

该论文聚焦于多轮视觉故事生成中的仇恨意图评估与检测问题。作者指出,图文绘本和漫画长期被用于传播仇恨叙事,因为它们易于理解,连儿童也能看懂,例如纳粹宣传绘本《Der Giftpilz》。随着Gemini、GPT-Image等前沿文本到图像系统的出现,跨轮次生成具有一致角色和场景的对话式图像已成为可能,这使得仇恨视觉故事(即有序图像组共同传达仇恨叙事)的生产变得低成本且可规模化。尽管已有工作研究了T2I系统生成仇恨内容,但主要针对单张图像,忽略了图像组层面的仇恨含义。为填补这一空白,作者引入了HatefulStoryPrompts数据集,包含55个仇恨故事、330种多轮配置,覆盖两种语言和三种视觉风格,并对五个前沿模型进行了4950次测试。结果显示,所有模型都能完成超过80%的故事,最强模型完成率达99.0%。作者进一步评估现有审核系统在HatefulVisualStory数据集(包含969个仇恨图像集和990个良性对照)上的表现,发现现有系统经常漏检群组级仇恨含义:专用安全模型召回率最高仅34.9%,而强大的视觉语言模型也仅达67.5%。最后,作者提出了互补的主动式与生成后防御措施:交互感知监控器在仅提示会话中实现97.3%的召回率,在用户提供首图时达到92.6%;而生成后方法联合分析完整图像组可达80.2%的召回率。该工作表明,随着图像生成从孤立输出演变为连贯视觉叙事,安全机制必须相应进化,从逐图像审核转向对交互和图像关系的状态化推理。

💡 推荐理由: 揭示了多轮T2I系统可被用于规模化生成仇恨视觉故事,而现有审核机制在群组级语义检测上严重不足,为防御方提供了新的检测思路和基线。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Madiha Tabassum, Alana Mackey, Ada Lerner

该论文研究在线社区版主(moderator)如何通过互助机制共同应对仇恨言论和骚扰。研究采用定性方法,包括深度访谈和内容分析,探讨版主之间的支持网络、知识共享以及情感互助如何增强其应对能力。核心发现包括:版主通过非正式社区、专用论坛或即时通讯群组分享应对策略、心理支持以及管理经验,从而缓解个人压力并提升审核效率。论文还识别了现有平台工具在促进互助方面的不足,并提出设计建议,如建立官方互助渠道、提供匿名支持选项等。研究贡献在于系统揭示了互助在版主工作中的关键作用,为平台设计更有效的社区治理机制提供了实证依据。适合关注在线内容审核、社区管理、平台安全的研究者和从业人员阅读。

💡 推荐理由: 揭示了在线社区版主互助在打击仇恨和骚扰中的关键作用,为平台优化治理机制、提升审核员心理韧性提供实证依据。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)