#unsafe-content

共收录 1 条相关安全情报。

← 返回所有主题
推荐 9.5
Conf: 50%
👥 作者: Yan Pang, Aiping Xiong, Yang Zhang 0016, Tianhao Wang 0001

该论文系统性地研究了视频生成模型(VGM)产生不安全内容(如暴力、恐怖、色情、政治敏感等)的风险。作者首先从4chan和Lexica等来源收集可能诱导不安全内容生成的提示词,并使用三种开源最先进视频扩散模型(如VideoFusion、ModelScope等)生成视频,经过滤后从5607个原始视频中筛选出2112个候选不安全视频。通过聚类和主题编码,归纳出五类不安全视频:扭曲/怪异、恐怖、色情、暴力/血腥和政治。经IRB批准,招募403名在线参与者对视频进行标注,最终确认937个不安全视频,并构建了首个VGM生成不安全视频数据集。针对现有防御方法(输入过滤或输出过滤)的不足,论文提出一种名为潜在变量防御(LVD)的新方法,该方法在模型内部采样过程的初始阶段检测不安全样本,通过分析潜在空间中的中间表示来判断是否生成不安全内容。实验表明,LVD在三个开源模型上分别达到0.99、0.92和0.91的防御准确率,且在对抗性提示和图像到视频扩散模型上准确率均超过0.90。与基线方法相比,LVD在大规模采样时可将时间和计算资源降低10倍。此外,LVD还能与其他防御方法组合使用以提升整体性能。论文将公开数据集和代码。

💡 推荐理由: 随着视频生成模型的普及,其产生不安全内容的潜在风险日益突出。该研究首次系统性地揭示了VGM的不安全生成问题,并提出了高效的内部防御机制LVD,为内容安全审核提供了新思路,值得安全从业者关注。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)