#knowledge-poisoning

共收录 7 条相关安全情报。

← 返回所有主题
👥 作者: Xue Tan, Xuandi Zeng, Yu Shao, Zhongli Fang, Mingyu Luo, Xiaoyan Sun, Ping Chen, Jun Dai

该论文研究的是视觉-语言检索增强生成 (VLRAG) 系统中的知识投毒问题。VLRAG 通过从外部知识库检索图像与文本证据来增强大型视觉-语言模型 (LVLM) 的回答, 使输出有据可依; 但检索管道同时构成了攻击面: 攻击者只要向知识语料注入少量图文对, 就可能通过被召回的毒化证据影响模型输出。作者指出, 现有知识投毒攻击基本都是“常开式” (always-on) 的, 即只要毒化证据被检索到就会影响生成, 缺乏精确的激活控制, 因此恶意行为难以限制在攻击者预期的输入上, 既降低了隐蔽性, 也降低了有效性 (容易在无关查询上暴露)。为此, 论文提出 ViTeGate, 一种面向 VLRAG 的双触发知识投毒框架: 使用视觉触发器有条件地把毒化证据“推”进检索结果, 再使用文本触发器诱导模型对检索到的证据给出攻击者预设的回答。两者协同实现了检索阶段与生成阶段的联合控制——缺少视觉触发时减少毒化证据的暴露, 缺少文本触发时保持正常回答, 从而降低单触发误激活带来的暴露风险。实验在多组查询数据集、多种检索器与多个 LVLM 上展开, 验证了该设计的有效性: 在 InfoSeek 数据集上攻击成功率最高可达 0.98, 同时干净输入的答案准确率最高保持在 0.93, 说明该攻击在实现高成功率的同时能较好维持正常功能表现。论文属于对抗性机器学习与多模态检索安全方向的学术研究, 适合从事 RAG/多模态系统安全、模型供应链与红队评估的读者阅读。

💡 推荐理由: 多模态 RAG 正快速进入企业知识库、图文问答等生产场景, 而本文证明检索语料投毒可以被条件触发, 传统“常开式”投毒的检测与防护假设可能失效; 安全团队需要重新评估检索层与生成层的联合可信性。

🎯 建议动作: 研究跟进, 并纳入内部多模态 RAG 系统的威胁建模与红队评估

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Haozhe Lu, Jiaqi Li, Xinyuan Zhu, Xiang Li

该论文研究检索增强生成(RAG)系统中的知识投毒风险。RAG 通过外部证据为大型语言模型(LLM)的输出提供依据,提升事实性,但同时也把外部知识库变成了攻击面。既有代表性攻击通常需要注入多篇文档,或使用直接断言目标答案的模板化文本,成本和可检测性较高。作者提出 ToxicRAG,一种“每个目标仅需一篇文档”的单次知识投毒攻击,其核心思路是把虚假信息包装成连贯的“知识更新”叙事:文档首先承认此前被广泛接受的答案,然后引入虚构事件使该答案看似已经失效,最后把攻击者选定的答案归因于一组所谓的权威来源,从而让投毒内容在语义上更自然、更像正常的知识演进。ToxicRAG 还包含一个可选的、以答案为中心的自验证循环:当代理语言模型无法复现目标答案时,攻击者据此修订候选文档,直至其更可能诱导受害者模型给出目标答案。实验方面,作者在 Natural Questions、HotpotQA 和 MS-ARCO 三个数据集上各取 100 个目标问题,使用 4 个受害 LLM 和 4 种稠密检索器,共 12 个数据集—模型组合。在论文所报告的采样语料设置下,ToxicRAG 的攻击成功率(ASR)介于 0.61 到 0.91 之间,并且在每一个组合中都达到或超过评估中最强的基线,领先幅度为 0 到 11 个百分点。论文的主要贡献在于:证明叙事形式的单文档投毒在受评估的 RAG 配置下仍具有显著影响力,揭示 RAG 在事实一致性和来源溯源方面的脆弱性,并呼吁进一步研究相关防御机制。适合 RAG 系统研发者、LLM 安全研究者与蓝队威胁建模人员阅读。

💡 推荐理由: 该研究把 RAG 知识投毒成本降到“每个目标一篇文档”,且用叙事化手法规避直接断言带来的可疑特征,对依赖外部知识库的企业问答、客服与搜索类 LLM 应用构成现实威胁;蓝队需要重新评估知识写入通道与检索结果的信任边界。

🎯 建议动作: 研究跟进,并将叙事式单文档知识投毒纳入内部 RAG 安全评估基线

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Muhaimin Bin Munir, Akib Jawad Ononto, Nazia Shehnaz Joynab, Bhavani Thuraisingham, Latifur Khan

这篇论文提出了一种针对检索增强生成(RAG)系统的知识投毒攻击防御框架。研究背景是:RAG通过外部语料库为大型语言模型提供事实依据,但系统对检索文档的隐式信任构成了严重攻击面。已有研究(如PoisonedRAG)表明,仅需少量精心构造的恶意文档即可在密集检索中占据主导地位,并引导模型生成攻击者预设的答案。针对这一威胁,作者提出了“三层筛”(Tri-Layer Sieve)中间件防御机制。该机制在检索后对文档证据进行三层净化:第一层通过跨嵌入空间聚类并引入独立评判模型,识别并隔离在多个嵌入模型中行为不一致的离群文档;第二层通过结构过滤检测触发词-载荷(Trigger-Payload)这类投毒文档特有的内部结构;第三层利用LLM自身的一致性验证来确认文档内容与生成答案的语义一致性。设计的核心思想是利用检索阶段投毒的固有弱点:单篇恶意文档必须同时迎合嵌入空间的几何特性、内部的触发-载荷结构以及最终的生成目标,三者同时满足极具挑战性,即使面对能对触发词进行改写以规避结构过滤的自适应攻击者,这种脆弱性依然存在。实验在NQ、HotpotQA和MS-MARCO数据集上使用Contriever检索器(k=50)进行,结果显示:将黑盒攻击成功率从67.0%/87.0%/64.0%分别降至3.0%/14.0%/4.0%;针对白盒HotFlip攻击,在NQ上启用第三层后成功率从约74%降至27.8%;受污染文档的MRR降至0.000,同时将攻击场景下的干净准确率从13-33%恢复至58-76%。在面对能改写触发词以绕过结构过滤的架构感知攻击者时,启用一致性验证层可将自适应攻击成功率减半(NQ上从32.0%降至15.0%),并将干净准确率提升18个百分点,但代价是每次实时检索增加约16-19秒延迟。该研究适用于关注RAG安全、对抗检索攻击及LLM安全防御的研究人员和工程师。

💡 推荐理由: RAG已成为企业落地LLM的主流方式,但检索注入攻击能低成本操纵模型输出。本方法提供了一种不依赖单一嵌入模型族、可对抗自适应攻击的防御原型,其跨嵌入一致性与三层校验思路对设计安全检索管线有直接借鉴价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Balkrishna Giri, Md Toufique Hasan, Jussi Rasku, Muhammad Waseem, Pekka Abrahamsson

本论文针对检索增强生成(RAG)系统中的安全性与可靠性缺口展开研究。RAG 通过引入外部知识来增强大语言模型(LLM)的输出,但现有系统往往盲目信任检索结果,导致高语义相关性并不保证事实真实性,从而形成安全-可靠性缺口。攻击者可利用知识投毒(Knowledge Poisoning)的方式,插入恶意文档,诱导模型生成定向错误信息。为此,论文提出一种评估代理(Evaluation Agent)作为中间件,结合自然语言推理(NLI)事实核查、包含加权聚合的五信号毒物检测器,以及信任指数 T = 0.4F + 0.35C + 0.25(1-P),并对高污染场景引入非线性阻尼器。在 TruthfulQA 基准上使用 Llama 3.3 70B 模型,该代理达到 91% 的准确率和 100% 的精确率,对指令注入(Instruction Injection)的召回率达到 100%;但对实体替换这类就地编辑(in-place edits)仍难以检测。在三个不同 LLM 上,信任指数保持区分度,ROC-AUC 介于 0.73 至 0.81;实验表明,生成风格比模型规模影响更大,且针对不同 LLM 校准阈值可恢复接近基线的竞争性准确率。而在较弱 FEVER 数据集上的结果则说明跨数据集泛化需要领域特定校准。在软件工程场景中,基于 OWASP Top 10 和 CWE 的安全编码助手,该代理能可靠阻止不安全建议的指令注入(F1 分数 92%),但矛盾信息与细微语义弱化仍然难以识别。研究强调,代理主要测量生成前对毒化上下文的检测能力,而非 LLM 是否实际采用了注入的错误信息。论文已发布相关方法、攻击生成器及实验工件。本文适合研究 RAG 安全、LLM 可信度评估及对抗性机器学习的读者参考。

💡 推荐理由: RAG 系统在生产环境迅速普及,但检索信任缺失导致知识投毒与误导信息风险极高。该评估代理提供了一种可落地的中间件方案,能有效检测指令注入等典型攻击,直接提升 LLM 应用的安全基线,值得安全工程师和 AI 平台团队关注。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinlong Xu, Yoshua Y. Li

检索增强生成(RAG)将外部语料库作为推理证据,但这也引入了安全风险:攻击者可通过注入恶意文档(知识投毒)来引导模型输出特定主张。现有检测方法通常依赖可信参考文档、特定攻击痕迹或全局阈值,这些方法在复杂语料拓扑下鲁棒性不足。本文提出 RAGSieve,一种自参考的检测框架,它通过从被检查的 RAG 系统自身构造参考,无需外部可信语料或投毒标签即可进行检测。RAGSieve 包含两个互补组件:RSQ(查询侧)在用户发起查询时工作,通过对比同一检索中前5个候选与排名6-20的结果,捕捉答案锚点集中与载体转移等异常;RSG(语料侧)在查询之前工作,将每篇文档与其语义相似但词汇不同的邻居进行比较,以识别协调性投毒密度。实验在三个问答数据集和六种投毒构造上进行,RSQ 的 AUROC 达95.2%,在移除5%干净文档时检测出82.2%的毒物,显著优于基线 GMTP(81.1%/52.5%);RSG 达93.3%/79.8%,优于 CleanBase(79.4%/37.6%)。联合使用两者可将攻击成功率从67.4%降至14.0%,同时在未投毒检索上保持41.3%的F1分数,说明该方法能在语料入库和查询阶段提供实际防护。该研究适合关注 LLM 供应链安全、检索系统可靠性的安全研究人员与 AI 安全工程师阅读。

💡 推荐理由: RAG 系统日益普及,但知识投毒攻击严重威胁其输出可靠性。现有检测方法依赖可信参考或全局阈值,难以应对多样化的投毒策略。RAGSieve 利用系统自身局部对比,无需外部信任假设,即可同时检测查询时和索引时的威胁,显著降低攻击成功率,为防御方提供了实用且鲁棒的检测框架。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Juho Park, Hyunmin Choi, Kevin Nam

本文研究了针对基于检索增强生成(RAG)的AI安全代理的知识投毒攻击。随着安全代理越来越多地依赖RAG从外部知识源(如CVE报告、CTF write-ups)获取漏洞分析和利用推理信息,攻击者可以通过注入恶意构造的write-up(称为Poisoned Playbooks)来操控代理的行为。作者在11个CTF挑战、3个先进LLM系列(含2代模型)和11个真实CVE上进行了系统实验,发现投毒效果具有系统性而非随机性:多数情况下,代理会采纳被投毒的信息并产生错误的行为。为解释这一现象,作者提出了验证边界(Verification Boundary, VB)的概念,这是一个三层次的经验分类,基于代理能够利用何种证据来反驳检索到的声明。此外,作者评估了验证提示(verification prompting)和多源检索(multi-source retrieval)两种防御措施,发现它们在存在强证据时有效,但在证据稀疏或零日条件下效果减弱。本文揭示了RAG安全代理面对知识污染时的脆弱性,并为设计更鲁棒的防御策略提供了理论基础。

💡 推荐理由: 揭示了AI安全代理在依赖外部知识时面临的新型投毒风险,对构建可信的自动化安全工具具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zhe Yu, Wenpeng Xing, Gaolei Li, Shuguang Xiong, Hongzhi Wang, Xuyang Teng, Meng Han

该论文针对检索增强生成(RAG)系统面临的知识投毒攻击,提出了一种基于信息流控制的防御框架CORDON-MAS。研究发现,现有防御方法(如污染检测)存在监控-控制差距:模型能够检测到检索结果中的矛盾证据,但仍会基于被污染的文档生成有害输出。作者提出科登原则(Cordon Principle):任何负责最终合成的智能体不得直接访问未受信任的自然语言证据。基于此原则,设计了CORDON-MAS框架,通过将证据提取、跨源审计和答案合成分离为具有非对称内存权限的独立智能体,从架构上强制实施信息流控制。在五个BEIR数据集上的实验表明,相比无防御的RAG系统,CORDON-MAS将攻击成功率降低了92.4%。该工作将RAG投毒问题从检测问题重新定义为信息流控制问题,为构建可信RAG系统提供了新思路。

💡 推荐理由: 首次揭示了RAG防御中监控-控制差距的存在,并提出将投毒防御从检测转向信息流控制的新范式,对保障基于RAG的高风险应用安全具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)