#implicit-toxicity

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Jiaxian Lv, Shiyao Cui, Yingkang Wang, Guoxin Wu, Qingling Zhang, Minlie Huang

本研究聚焦于多图像内容中一种新型安全威胁——多图像隐式毒性(MIIT)。MIIT指的是每张图片单独看起来无害,但当多张图片被联合解读时,会产生有害语义。这种威胁在社交媒体中日益普遍,但现有的商业内容审核API和模型因缺乏每张图片中的显式风险线索而难以应对。本文首先给出了MIIT的形式化定义,并分析了检测该威胁的三个关键挑战:隐式语义组合、上下文依赖性和缺乏标注数据。为缓解数据稀缺问题,研究者通过自动化生成管道构建了MIIT-dataset,这是一个仅包含图像的多图像安全数据集,涵盖七个代表性风险类别(如仇恨言论、暴力、性暗示等)。在此基础上,他们提出了MiShield模型,该模型通过渐进式蒸馏推理监督进行训练,能够生成安全判断并附带有害相关实体的显式分析。实验表明,MiShield-8B模型在MIIT检测任务上优于代表性审核服务(如Google Cloud Vision、Amazon Rekognition)甚至更大规模的模型(如Gemini、GPT-4V),揭示了该模型对于这一广泛使用的视觉格式的有效性和实用价值。该论文同时也包含潜在敏感内容,警告读者注意。

💡 推荐理由: MIIT揭示了传统单图审核的盲区,多图组合可能传播隐蔽有害信息,威胁社交媒体内容安全。相关方需警惕此类隐式毒性并改进审核策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)