#content-moderation

共收录 12 条相关安全情报。

← 返回所有主题
👥 作者: Lucy Qin, Jaron Mink, Elissa M. Redmiles

该研究聚焦于AI生成性内容(AIG-SC)在线社区中的治理问题。随着AI生成性内容的生产日益增多,大量支持创作者需求的在线社区应运而生,其中一些大型社区(成员数超过1万)明确制定了禁止创建和分享滥用性内容(例如AI生成的儿童性虐待材料,CSAM)的规则。为理解社区治理尝试如何在支持自由表达的同时防止滥用,研究者对24名来自此类大型社区的成员和版主进行了深度访谈。研究从四个维度展开分析:(1)这些社区形成的方式和原因;(2)隐含的社区规范;(3)明确陈述的规则及其通过内容审核的落地操作;(4)社区价值观与审核之间的张力如何为滥用行为留下空间。主要发现包括:尽管许多创作者和个人对滥用设有个人边界,但关于创建任意形式AI生成性内容的建议和资源对所有用户开放,不论其意图如何;社区中反审查和不评判的规范进一步复杂化了内容审核,导致版主被迫以法律和平台服务条款的边界来为自己行为辩护。研究最后反思了技术、社区和法律治理的结合如何最有效地减少滥用性内容的生产。这项工作对理解在线社区中AI内容治理的挑战、规范与法律框架的互动具有重要参考价值,适合平台治理研究者、政策制定者及内容审核策略设计者阅读。

💡 推荐理由: 揭示了AI生成性内容社区中治理机制的现状与漏洞,为平台设计更有效的滥用内容防控策略提供实证依据,尤其对防范AI生成CSAM等严重风险有参考意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christopher M. Frost

流式大语言模型(LLM)输出在逐 token 释放时面临审核时机困境:若等待完整输出再审核,敏感内容已经到达用户;若对每个前缀反复进行语义分类,则计算开销大且结果不稳定。本文提出一种确定性的配对完成防护栏(pair-completion guardrail)构造:将每个需要拦截的危险签名定义为两个词法谓词的合取(conjunction)。在每次释放新 chunk 之前,守护程序扫描当前累积前缀;一旦前缀同时满足这两个谓词,就扣留当前 chunk,从而在精确的边界处阻止危险签名完整出现。实验覆盖 4 个签名族、8 种 chunk 大小及 32 次机制试验,流式决策与缓冲扫描器完全一致,并成功扣留每一个使谓词对完整匹配的 chunk;8 个单谓词对照组全部通过,说明机制具备选择性。在另一次 512 次试验的策略对比中,全前缀扫描和完整缓冲能检测所有配置的配对,512 字符滑动窗口检测出 96/128,chunk 局部扫描仅检测出 38/128,凸显了扫描范围对覆盖率的影响。固定签名对在 338 条人工标注的安全响应上误报为 0,在 394 条陪审团标注的不安全响应上检出为 0,证明该方法只覆盖窄范围的预定签名,而非通用语义危害。校准的 Llama Guard 3 1B 基线对同一批数据分别正确分类 310/338 安全响应和 202/394 不安全响应。性能方面,对 16,384 字符响应进行重复前缀扫描,耗时随 chunk 大小在 13.261 ms 至 829.640 ms 之间变化。作者总结:配对完成机制适合作为小型固定策略的精确释放边界兜底,不能替代语义审核。该研究对 LLM 流式输出的安全护栏设计具有参考价值。

💡 推荐理由: 流式 LLM 输出审核时机是实际部署中的难点。本文给出一种确定性、可验证的配对扣留方案,为安全工程师提供低成本、零误报(针对固定规则)的边界控制思路,也让社区意识到需要将窄规则与语义审核分层组合。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ye Leng, Junjie Chu, Yiting Qu, Mingjie Li, Yun Shen, Yang Zhang

该论文聚焦于多轮视觉故事生成中的仇恨意图评估与检测问题。作者指出,图文绘本和漫画长期被用于传播仇恨叙事,因为它们易于理解,连儿童也能看懂,例如纳粹宣传绘本《Der Giftpilz》。随着Gemini、GPT-Image等前沿文本到图像系统的出现,跨轮次生成具有一致角色和场景的对话式图像已成为可能,这使得仇恨视觉故事(即有序图像组共同传达仇恨叙事)的生产变得低成本且可规模化。尽管已有工作研究了T2I系统生成仇恨内容,但主要针对单张图像,忽略了图像组层面的仇恨含义。为填补这一空白,作者引入了HatefulStoryPrompts数据集,包含55个仇恨故事、330种多轮配置,覆盖两种语言和三种视觉风格,并对五个前沿模型进行了4950次测试。结果显示,所有模型都能完成超过80%的故事,最强模型完成率达99.0%。作者进一步评估现有审核系统在HatefulVisualStory数据集(包含969个仇恨图像集和990个良性对照)上的表现,发现现有系统经常漏检群组级仇恨含义:专用安全模型召回率最高仅34.9%,而强大的视觉语言模型也仅达67.5%。最后,作者提出了互补的主动式与生成后防御措施:交互感知监控器在仅提示会话中实现97.3%的召回率,在用户提供首图时达到92.6%;而生成后方法联合分析完整图像组可达80.2%的召回率。该工作表明,随着图像生成从孤立输出演变为连贯视觉叙事,安全机制必须相应进化,从逐图像审核转向对交互和图像关系的状态化推理。

💡 推荐理由: 揭示了多轮T2I系统可被用于规模化生成仇恨视觉故事,而现有审核机制在群组级语义检测上严重不足,为防御方提供了新的检测思路和基线。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

本文针对现代基于大模型的多模态内容审核系统展开鲁棒性研究。传统内容审核分类器通常依赖任务特定模型,策略覆盖有限且缺乏上下文理解;而新近商业化的多模态审核 API 基于大型基础模型,宣称能提供更广泛、更强大的安全过滤能力。研究团队对三家成熟商业图像审核服务进行了大规模黑盒评估,系统比较其鲁棒性。他们设计了七种简单、与模型无关的图像变换方法,并在多个提供商、数据集、危害类别、感知相似度约束及变换强度下进行测试。结果表明:(1)三家商业服务均可被廉价图像变换绕过,且这些变换不需要梯度、替代模型或对目标系统的内部知识;(2)即使是固定变换如颜色反转和灰度化,也能诱导“不安全→安全”的决策翻转,同时保持图像内容对人类依然可辨认;(3)不同数据集和危害类别下各服务的鲁棒性差异显著,尤其是多模态内容和自伤类内容表现出明显弱点。作者由此得出结论:用基础模型 API 替代传统审核分类器本身并不能提供可靠的安全边界;此类系统必须在现实变换条件下进行评估,并作为分层审核流水线中的一个组件部署,而非作为独立安全过滤器。本文适合内容安全平台开发者、审核系统设计者以及关注 AI 安全鲁棒性的研究人员阅读。

💡 推荐理由: 揭示了大模型审核 API 的‘安全幻觉’:简单图片处理即可导致审核失效,提醒安全团队不能盲目信任商业审核服务,需结合多层检测与人工兜底。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Filipo Sharevski, Verena Distler, Florian Alt

该论文研究社交媒体平台X(原Twitter)上的‘软性审核’(如事实核查标签、警告标签)对用户感知不真实政治内容准确性及分享意图的影响。通过实验方法,作者探讨了软性审核措施如何改变用户对虚假或误导性政治信息的认知,并分析了这些措施在实际平台中的效果。研究发现,软性审核标签能显著降低用户对不真实内容的准确性判断,并减少其分享意愿,但效果受用户政治倾向和内容类型影响。该工作为内容审核策略提供了实证依据,有助于理解用户行为与平台干预之间的互动。

💡 推荐理由: 帮助安全分析师理解社交媒体平台上的虚假信息对抗手段的实际效果,为设计更有效的用户警示和内容标注策略提供参考。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.3)
👥 作者: A. Krylov, D. Rakhov, V. Veselova, D. Bolokhov, Oleg Y. Rogov

该论文提出了一种基于大语言模型引导的演化框架(结合GigaEvo和OpenEvolve),用于对感知哈希算法(PHA)实施有针对性的黑盒第二图像攻击。感知哈希算法广泛应用于图像篡改检测,但对抗性扰动的鲁棒性研究不足。作者设计了一个复合评分函数,综合考虑攻击成功率(归一化汉明距离低于阈值的对抗样本比例)、对哈希函数的查询次数以及相对于原始图像的L2失真度。在pHash、PDQ、PhotoDNA和NeuralHash四种部署的PHA上,使用30对ImageNet图像进行实验,结果表明:与现有黑盒基线相比,该方法能以更少的查询次数达到相当或更高的攻击成功率,同时产生更低的L2失真。最佳演化程序将预定义的复合攻击评分降低了:NeuralHash 41.2%、PDQ 38.3%、pHash 34.0%、PhotoDNA 8.1%。该方法不需要PHA内部知识,能自然处理哈希输出的不可微离散性。这些结果揭示了广泛部署的内容审核流水线中此前未被报告的安全漏洞,并激励开发可证明鲁棒的感知哈希方案。适合安全研究员、内容审核系统开发者以及对抗性机器学习研究者阅读。

💡 推荐理由: 揭示了广泛部署的感知哈希算法(PhotoDNA、pHash、PDQ、NeuralHash)在黑盒攻击下的脆弱性,威胁内容审核和图像取证的安全性。

🎯 建议动作: 研究跟进并评估自身内容审核流水线中使用的哈希算法的鲁棒性

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Qin Yang, Lu Malloy, Joshua Lee, Xiaohan Chang, Meisam Mohammady, Doowon Kim, Yuan Hong

这篇论文研究了基于大型语言模型(LLM)的内容审核系统在视觉感知上的盲点。作者指出,当前的内容审核系统主要依赖令牌化文本,忽略了人类在理解内容时所依赖的视觉线索,例如字体、间距、排列等排版特征。这种感知不匹配导致:人类能轻易识别的有害内容,对自动审核系统来说可能完全不可见。为了系统性地研究这一漏洞,作者提出了一类新的攻击手段——人类感知对抗攻击(Human-Perceptible Adversarial Attacks, HPAA)。其核心思想是通过视觉上显著的排版操纵,将有害表达嵌入到看似无害的文本中,使得人类仍能识别其有害性,而机器检测率大幅下降。攻击完全在黑盒设置下进行,仅需少量查询(实验中仅需3次),无需模型访问或梯度信息。作者在多个数据集和十种实际部署的审核系统(包括商业API和最先进的开源防护栏)上评估了攻击效果。结果显示,攻击生成的内容在人类识别率超过86%的同时,在所有被评估系统上的检测率均低于1%。进一步的消融实验分析了促成成功规避的排版因素,并讨论了当前审核架构为何无法捕捉这些信号。最后,作者提出了一些实用性防御措施。该研究揭示了当前基于LLM的审核生态系统中的一个根本盲点,强调需要开发能够更符合人类感知理解的内容审核系统。

💡 推荐理由: 该研究揭示了LLM内容审核系统在视觉感知层面的结构性缺陷,攻击仅需少量查询即可实现极低检测率,对依赖LLM过滤有害内容的平台构成潜在威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Qingying Hao, Licheng Luo, Steve T. K. Jan, Gang Wang 0011

本论文研究了感知哈希(Perceptual Hashing)算法的安全性,重点关注其在实际应用(如版权检测、内容审核)中的脆弱性。作者提出了一种针对感知哈希的对抗性攻击方法,能够操纵图像使得其感知哈希值在攻击者控制下发生变化,而视觉效果保持相似或不同。具体来说,攻击者可以生成两张视觉上相同但哈希值截然不同的图像,或者视觉上不同但哈希值相同的图像。这种攻击利用了感知哈希算法对图像微小扰动的敏感性,通过优化噪声添加来实现。实验在pHash、DCT-based哈希等常见感知哈希算法上进行,证明了攻击的有效性。结果表明,基于感知哈希的应用可能被欺骗,从而绕过版权检测、虚假删除合法内容或隐藏恶意内容。论文还讨论了潜在防御策略,如更鲁棒的哈希设计或结合图像质量指标。该工作揭示了感知哈希在安全关键场景中的不足,对内容平台和数字取证领域具有重要警示意义。

💡 推荐理由: 感知哈希广泛应用于版权检测和内容审核,该攻击揭示其易被操纵,可能导致误判或滥用,影响平台安全与内容合规。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Saidu Sokoto, Leonhard Balduf, Dennis Trautwein, Yiluo Wei, Gareth Tyson, Ignacio Castro, Onur Ascigil, George Pavlou, Maciej Korczynski, Björn Scheuermann 0001, Michal Król

本论文研究去中心化文件系统 IPFS(星际文件系统)中的内容审核挑战。IPFS 作为“去中心化网络”的重要组成部分,其分布式架构使得内容管理极为困难。作者通过分析 368,762 个文件,系统性地识别、分类并测量了 IPFS 中存在的问题内容(例如已被下达删除通知的文件)。研究覆盖了完整的内容审核流程:文件如何被标记、谁托管和检索这些文件,以及审核流程的有效性。作者分析了提交到拒绝列表的内容,发现大量问题内容仍被提供服务,且缺乏中心化机制反而促进了问题内容的传播。尽管作者观察到对删除请求的快速响应,但测试了多个网关的弹性后表明,现有过滤手段可以被规避。最终,论文提出了改进内容审核的方案:在检测钓鱼内容方面提高了 227% 的识别率,并将平均过滤时间缩短了 43%。这项工作对去中心化平台治理、内容安全以及分布式系统安全具有重要参考价值。

💡 推荐理由: 随着去中心化存储和网络的发展,缺乏中心化审核机制使得非法或有害内容更难管控。该研究首次大规模量化了 IPFS 上问题内容的传播与审核困境,为安全社区设计去中心化内容治理方案提供了实证依据。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Priya Kaushik, Sonja Brown, Rakibul Hasan, Sazzadur Rahaman

该研究对 Roblox 平台的聊天安全审核系统进行了首次独立评估。Roblox 拥有数亿每日活跃用户,其中大量为未成年人,这使其成为恶意用户通过实时聊天接触潜在受害者的高风险环境。研究者从四个不同年龄分组的公开游戏服务器中,遵循伦理、法律规范及 Roblox 服务条款,收集了约 200 万条聊天消息作为语料库。由于数据规模庞大,无法完全依赖人工分析,他们采用了两阶段方法:首先人工标记了 99,800 条消息作为安全/不安全的基准真值,并用此评估了四款本地部署的先进大语言模型(LLMs)的分类性能;随后将表现最佳的 LLM 应用于全部语料,识别出潜在不安全消息,再通过迭代开放式和轴式编码进行人工归类,直至达到主题饱和。研究结果显示,当前审核系统存在严重漏洞:大量涉及诱骗、性化未成年人、欺凌骚扰、暴力、自残、共享敏感信息等不安全聊天消息成功逃脱审核。进一步分析表明,那些消息曾被标记过的用户,会采用多种技术(如变体拼写、同音词、隐晦表述等)持续发送有害消息以规避审核。该研究系统性地揭示了现有自动化审核机制的不足,强调了针对青少年社交平台的内容审核亟需改进。

💡 推荐理由: Roblox 是青少年最常使用的平台之一,其聊天审核失效可能直接导致未成年人面临诱骗、骚扰等严重风险。本研究首次独立验证了审核系统的实际效果,为安全团队理解绕过手法和优化检测策略提供了实证基础。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Anna Ablove, Shreyas Chandrashekaran, Xiao Qiang, Roya Ensafi

本文系统地研究了中文大型语言模型(LLM)服务中内容审查政策的实现方式。研究团队设计并实现了一个自动化测试框架,通过向多个主流中文LLM服务(如百度文心一言、阿里巴巴通义千问等)发送精心构造的提示词,评估它们对敏感话题(如政治、历史、社会事件等)的响应一致性。实验发现,不同服务在审查的严格程度、触发审查的关键词模式、以及拒绝回答的措辞上存在显著差异。部分服务会直接拒绝回答,另一些则提供符合官方立场的回答,还有服务会给出模糊或转移话题的回复。论文进一步分析了审查政策的文本依据,并讨论了这种不一致性对用户信息获取和言论自由的影响。研究贡献在于首次大规模、多维度地刻画了中国LLM服务的审查实现现状,为理解AI时代的信息控制提供了实证数据。

💡 推荐理由: 揭示了中文LLM服务审查政策的实现差异,对理解AI内容监管、用户信息获取质量及跨国服务合规具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Friedemann Lipphardt, Moonis Ali, Martin Banzer, Anja Feldmann, Devashish Gosain

本研究对大型语言模型(LLM)中的内容审核机制进行了全球范围的系统性分析。论文首先指出现有LLM部署时通常内置了内容过滤器以阻止有害或不当内容,但这些过滤器的有效性和一致性在全球不同地区因语言、文化、法律和监管环境的差异而存在显著不确定性。作者收集了多个主流LLM(如GPT-4、Claude、Llama等)的公开API和开源模型,设计了一套涵盖仇恨言论、敏感政治话题、暴力、色情等类别的多语言测试提示集,覆盖英语、中文、阿拉伯语、俄语、西班牙语等10种主要语言。通过自动化测试和人工评估相结合的方式,报告了不同模型在不同语言下对同一内容管制的差异——某些语言(如英语)的内容过滤极为严格,而其他语言(如低资源语种)则几乎无限制。进一步地,论文还揭示了特定区域(如中国大陆)的模型版本在政治敏感话题上存在额外的本地化审核规则,体现了“套娃式”的审核层级。实验表明,许多LLM的内容审核并非基于统一价值观,而是受到部署地区法律和社会规范的深刻影响,甚至出现“Ba Sing Se”(《降世神通》中虚构的乌托邦城市,寓意掩盖真相)式的表面和谐。该研究的核心贡献在于首次在大规模、多语言、多模型背景下量化了LLM内容审核的地理不均匀性,并提出了威胁分类法(taxonomy)来表征不同级别的审核力度。对于安全从业者而言,本文揭示了通过语言或区域转变绕过内容过滤的潜在攻击面,并强调了在全球化部署中维护一致性审核策略的挑战。

💡 推荐理由: 揭示了LLM内容审核存在的区域差异,可能被攻击者利用以绕过安全限制,对跨国部署的AI系统构成潜在威胁。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)