该论文聚焦于多轮视觉故事生成中的仇恨意图评估与检测问题。作者指出,图文绘本和漫画长期被用于传播仇恨叙事,因为它们易于理解,连儿童也能看懂,例如纳粹宣传绘本《Der Giftpilz》。随着Gemini、GPT-Image等前沿文本到图像系统的出现,跨轮次生成具有一致角色和场景的对话式图像已成为可能,这使得仇恨视觉故事(即有序图像组共同传达仇恨叙事)的生产变得低成本且可规模化。尽管已有工作研究了T2I系统生成仇恨内容,但主要针对单张图像,忽略了图像组层面的仇恨含义。为填补这一空白,作者引入了HatefulStoryPrompts数据集,包含55个仇恨故事、330种多轮配置,覆盖两种语言和三种视觉风格,并对五个前沿模型进行了4950次测试。结果显示,所有模型都能完成超过80%的故事,最强模型完成率达99.0%。作者进一步评估现有审核系统在HatefulVisualStory数据集(包含969个仇恨图像集和990个良性对照)上的表现,发现现有系统经常漏检群组级仇恨含义:专用安全模型召回率最高仅34.9%,而强大的视觉语言模型也仅达67.5%。最后,作者提出了互补的主动式与生成后防御措施:交互感知监控器在仅提示会话中实现97.3%的召回率,在用户提供首图时达到92.6%;而生成后方法联合分析完整图像组可达80.2%的召回率。该工作表明,随着图像生成从孤立输出演变为连贯视觉叙事,安全机制必须相应进化,从逐图像审核转向对交互和图像关系的状态化推理。
💡 推荐理由: 揭示了多轮T2I系统可被用于规模化生成仇恨视觉故事,而现有审核机制在群组级语义检测上严重不足,为防御方提供了新的检测思路和基线。
🎯 建议动作: 研究跟进