#rag

共收录 57 条相关安全情报。

← 返回所有主题
👥 作者: Alexandr Goultiaev Tolstokorov, Kyriakos Mouratidis, Javad Dogani, Nikolaos Laoutaris

本文针对第三方检索增强生成(RAG)市场中的新型审计问题展开研究。具体而言,数据提供方将语料库授权给RAG运营方后,往往无法获知其文档是否被未经补偿地重用。由于运营方不合作、生成器会对答案进行改写、且单次回答可能融合多个提供方的证据,审计此类滥用十分困难。为此,作者提出DirBucket——一种提供方侧语义水印和黑盒审计框架,用于多提供方RAG场景下的文档级重用检测。DirBucket通过对文档进行保留语义的同义改写来嵌入水印,使文档嵌入向量朝提供方特定的桶秘密方向偏移,从而在不破坏检索效用的前提下,能够从黑盒回答中检测出文档是否被重用。在一个反映混合提供方重用与黑盒访问的挑战性基准上,DirBucket是唯一能在无任何非目标激活的情况下始终实现强目标检测的方法;在主基准的每次审计中,它平均仅需23条被审计回答即可发现不合规行为。该水印还能抵御针对回答的事后清洗攻击,且所评估的逃避策略均无法在保持用户感知答案质量的同时彻底击败检测。此外,检测能力无需调整即可迁移到基于真实临床、网络威胁情报及法律提供方语料库构建的第二个基准上。实验结果证明,嵌入空间水印可以使第三方RAG中的文档重用具备统计学上的可审计性。本文适合关注大模型安全、数据知识产权保护、RAG系统合规审计的研究人员与蓝队成员阅读,其贡献在于提供了一种不依赖运营方配合的、可实际部署的追踪机制。

💡 推荐理由: RAG服务中数据滥用行为难以取证,本文提供了首个可统计审计的嵌入空间水印方案,帮助数据提供方在不访问模型内部的情况下发现未授权内容重用,对知识产权保护和合规审计有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Varun Gadey, Ziad Marey, Alexandra Dmitrienko

该论文研究检索增强代码生成(RACG)系统中的知识投毒攻击。RACG通过从外部代码库、文档和补丁中检索知识并注入到生成上下文,显著提升了大语言模型(LLM)的代码生成能力,但也引入了新的信任边界:恶意构造的代码工件可以在不修改底层LLM的情况下影响生成结果。已有工作表明,选择现有脆弱示例可以提高RACG输出的整体漏洞率,但尚未解决黑盒攻击者能否构造一个针对单一任务匹配的恶意工件,来传播攻击者选定弱点的问题。为此,论文提出了CodePoisonRAG,一种目标性上游知识投毒框架,将良性的固定代码条目转换为中毒工件。攻击链结合两类技术:一是CWE特定漏洞注入(Vulnerability Injection),将选定的source-to-sink数据流嵌入代码且保持任务对齐;二是语义错标(Semantic Mislabeling),在不修复脆弱行为的前提下添加虚假的安全性声明。攻击者无法访问受害者的已部署知识库、检索器、重排器、生成器、提示词或防御机制,且每个任务最多注入一个工件。作者构造了85个中毒工件,覆盖Java和C语言中的10个CWE类别,总体语料投毒比例为0.7%。实验结果表明,在三个生成器上所有85个工件都出现在对应查询的结果前3名中,攻击成功率介于0.80至0.93之间。针对CodeGuarder(一种向生成上下文注入特定漏洞安全知识的防御机制),攻击成功率仍保持在0.40至0.71之间。研究证明RACG投毒不仅可能利用现有漏洞的偶然传播,更可以有针对性地构造并传播攻击者选定的弱点。该工作适合关注AI供应链安全、代码生成安全及检索增强系统对抗鲁棒性的研究人员和安全工程师阅读。

💡 推荐理由: 揭示了RACG在代码生成场景中的新型供应链攻击面:仅需在公开知识库中注入少量恶意工件,即可高概率诱导LLM生成带特定CWE漏洞的代码,且可绕过现有基于上下文安全的防御。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bing Zheng, Zongyao Zhao, Wenming Yang

本文提出生成式引擎优化(GEO)技术在信息对抗中的双刃剑效应。GEO 本用于内容生产者提升其网页在生成式搜索引擎中的可见性,但攻击者可利用同一套技术发布外观正常的 GEO 优化文档,诱导受害大语言模型(LLM)在检索时将这些文档合成进回答中,从而向用户传递定向虚假信息。现有防御评测大多聚焦于政策违规或恶意内容,缺乏针对这种通过检索增强生成(RAG)路径传播的 GEO 信息扭曲威胁的受控评测基准。为此,作者构建了 Counter-GEO-Bench,一个包含 247 条人工验证、质量受限查询的防御评测基准,每条查询同时提供信息保持型与信息扭曲型两种 GEO 改写版本。基准在三个受害 LLM 上从攻击成功率(ASR)、误报率和回答质量三个维度评估防御效果。实验发现,三种现成防御手段(Granite Guardian、Llama Guard 3、NeMo Self-Check Fact-Checking)最多只能将 ASR 相对降低 5.7%,其中 Granite Guardian 的降低在统计上不显著。原因在于这些安全分类器主要针对政策违规,而 GEO 生成的虚假信息以流畅的事实性内容形式出现,能轻易绕过安全分类体系。为解决该问题,作者提出一个轻量级基准基线 C-GEO Guard,通过对比原始查询与 GEO 改写内容的语义一致性来识别信息扭曲,能将 ASR 相对降低 47.6%,且几乎不损失回答质量,从而证明该威胁是可应对的。该研究为生成式搜索引擎的检索侧防御提供了首个标准化评测框架,并为后续防御设计指明了方向。适合关注 LLM 安全、搜索对抗和信息完整性的研究与工程人员阅读。

💡 推荐理由: GEO 攻击将虚假信息伪装成普通网页内容,绕过现有 LLM 安全分类器,直接影响生成搜索引擎与 RAG 系统的可信度。该基准与基线为防御方提供了首个可量化评测手段,值得 SOC/安全研究员关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Muhaimin Bin Munir, Akib Jawad Ononto, Nazia Shehnaz Joynab, Bhavani Thuraisingham, Latifur Khan

这篇论文提出了一种针对检索增强生成(RAG)系统的知识投毒攻击防御框架。研究背景是:RAG通过外部语料库为大型语言模型提供事实依据,但系统对检索文档的隐式信任构成了严重攻击面。已有研究(如PoisonedRAG)表明,仅需少量精心构造的恶意文档即可在密集检索中占据主导地位,并引导模型生成攻击者预设的答案。针对这一威胁,作者提出了“三层筛”(Tri-Layer Sieve)中间件防御机制。该机制在检索后对文档证据进行三层净化:第一层通过跨嵌入空间聚类并引入独立评判模型,识别并隔离在多个嵌入模型中行为不一致的离群文档;第二层通过结构过滤检测触发词-载荷(Trigger-Payload)这类投毒文档特有的内部结构;第三层利用LLM自身的一致性验证来确认文档内容与生成答案的语义一致性。设计的核心思想是利用检索阶段投毒的固有弱点:单篇恶意文档必须同时迎合嵌入空间的几何特性、内部的触发-载荷结构以及最终的生成目标,三者同时满足极具挑战性,即使面对能对触发词进行改写以规避结构过滤的自适应攻击者,这种脆弱性依然存在。实验在NQ、HotpotQA和MS-MARCO数据集上使用Contriever检索器(k=50)进行,结果显示:将黑盒攻击成功率从67.0%/87.0%/64.0%分别降至3.0%/14.0%/4.0%;针对白盒HotFlip攻击,在NQ上启用第三层后成功率从约74%降至27.8%;受污染文档的MRR降至0.000,同时将攻击场景下的干净准确率从13-33%恢复至58-76%。在面对能改写触发词以绕过结构过滤的架构感知攻击者时,启用一致性验证层可将自适应攻击成功率减半(NQ上从32.0%降至15.0%),并将干净准确率提升18个百分点,但代价是每次实时检索增加约16-19秒延迟。该研究适用于关注RAG安全、对抗检索攻击及LLM安全防御的研究人员和工程师。

💡 推荐理由: RAG已成为企业落地LLM的主流方式,但检索注入攻击能低成本操纵模型输出。本方法提供了一种不依赖单一嵌入模型族、可对抗自适应攻击的防御原型,其跨嵌入一致性与三层校验思路对设计安全检索管线有直接借鉴价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jaewon Jung, Haizhong Zheng, Hongsun Jang, Jaeyong Song, Beidi Chen, Jinho Lee

检索增强生成(RAG)通过引入外部文档来增强大语言模型(LLM),但公共或用户可编辑的内容源为数据投毒攻击提供了可能。攻击者可以注入恶意文档,引导模型输出攻击者期望的答案。现有的投毒攻击通常依赖在恶意文档中包含目标查询(query inclusion),以提升检索命中率,但这会在词汇和嵌入空间留下明显伪影,容易被检测过滤。针对这一漏洞,本研究提出CamoDocs攻击,通过在良性内容中伪装对抗文档来避免直接查询包含。具体来说,CamoDocs将合成的良性分块和对抗性草稿分块混合,用分散token替换良性分块中的选定token,从而在嵌入空间中分散恶意文档的表示,并通过一致性过滤来限制文档可读性的下降。实验表明,CamoDocs在7种RAG防御机制、3种开源LLM和3个基准数据集上均实现了较高的平均攻击成功率(ASR),并能规避简单的查询检测。在专有模型上同样有效,对GPT-5.4-mini的平均ASR达61.80%,对Claude-Haiku-4.5达55.09%。此外,研究显示,类似TrustRAG这类大量依赖聚类/擦除的防御可以降低ASR,但在如NeoQA等依赖检索的基准上会导致显著的效用下降。这项研究揭示了现有RAG数据投毒防御的漏洞,提醒安全社区需要开发更鲁棒的检测与防御策略。

💡 推荐理由: 该攻击绕过了现有基于查询重叠的检测,对使用公开或用户可编辑文档源的RAG系统构成实际威胁,需引起蓝队注意。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Peichun Hua, Danyang Chen, Junan Zhang, Haifeng Sun, Jingyu Wang, Diwen Xue, Mingyu Li, Yunming Xiao

本文提出了一种实用的私有密集检索方案,用于托管式检索增强生成(RAG)和语义搜索场景。研究背景是:用户希望查询提供方持有的有价值的语料库,但存在两个相互矛盾的需求:一方面需要隐藏用户的查询和最终选择的结果,另一方面又只能向用户展示其被授权访问的文档。现有的密码学方法要么需要对整个语料库进行全量加密处理,导致每次查询成本高昂;要么通过扫描少量聚类牺牲检索质量来换取效率。本文的核心创新是将学习式深度哈希用作隐私过滤器:通过一个随机化的二进制代码将提供方指向一个较短的候选列表,然后使用加密重排序和遗忘密钥传输来保护精确查询和最终选择。这种方法避免了全语料库密码学搜索的开销,同时不牺牲检索质量:仅需200-500个候选文档,就能在五个零样本语料库(规模从2.5万到540万篇文档)上紧密匹配全语料库检索的性能。在包含268万段落的NQ语料库上,通过10Gbps链路,该协议仅为128-token的Qwen3-32B RAG流水线增加了0.73秒的额外开销,即约10%的延迟增幅。作者发布的相关代码满足方向性度量差分隐私(DP),并显著降低了嵌入反演和属性推断泄露。实验证明,经过精心学习的候选列表可以使私有密集检索既准确又实用。该研究适合关注隐私保护、检索增强生成、信息检索和安全领域的学者与工程师阅读。

💡 推荐理由: 该方案直接解决了托管RAG和语义搜索中查询隐私与授权访问的矛盾,能在不牺牲检索质量的前提下大幅降低隐私开销,为实际部署隐私保护检索提供了可行路径。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Minh Tran, Cuong Dang, Tuc Nguyen, Khanh-Tung Tran, Minh Huynh Nguyen, Trinh Chau, Kien Le, Do Xuan Long, Jiahao Zhang, Fali Wang, Hoang D. Nguyen, Thanh Le, Suhang Wang

该论文是一篇关于检索增强生成(RAG)安全与鲁棒性的系统性综述。RAG 通过引入外部知识库来增强大语言模型,能够提升事实性和减少幻觉,但与此同时,检索-生成流水线也引入了新的安全风险,例如语料库投毒(corpus poisoning)、后门攻击(backdoor attacks)、隐私泄露(privacy leakage)以及公平性破坏(fairness violations)。现有综述在攻击者目标、威胁模型和分阶段防御的覆盖上存在局限。为此,本文提出了一种统一的、面向流水线的 RAG 鲁棒性研究框架。作者首先对语料库、检索器和生成器分别形式化定义了威胁模型,并将攻击归纳为三大目标:准确性(accuracy)、隐私(privacy)和公平性(fairness)。随后,他们从流水线视角系统梳理了防御措施,覆盖检索(retrieval)、重排(rerank)、生成(generation)和追踪(traceback)等阶段。此外,文中还总结了用于评估和解释 RAG 鲁棒性的基准测试(benchmarks)与可解释性方法(explainability methods)。该综述的贡献在于提供了一个统一的、按流水线阶段和组织目标分类的攻击与防御全景,弥补了现有研究在系统性上的不足。适合关注大模型安全、RAG 应用防护以及可信 AI 的研究人员和工程师阅读。

💡 推荐理由: RAG 已广泛用于企业知识库问答等场景,但其流水线引入的投毒、后门、隐私泄露等风险尚未被多数安全团队充分认识。该综述提供了体系化的威胁建模与防御视角,有助于蓝队提前识别和缓解 RAG 特有攻击面。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Balkrishna Giri, Md Toufique Hasan, Jussi Rasku, Muhammad Waseem, Pekka Abrahamsson

本论文针对检索增强生成(RAG)系统中的安全性与可靠性缺口展开研究。RAG 通过引入外部知识来增强大语言模型(LLM)的输出,但现有系统往往盲目信任检索结果,导致高语义相关性并不保证事实真实性,从而形成安全-可靠性缺口。攻击者可利用知识投毒(Knowledge Poisoning)的方式,插入恶意文档,诱导模型生成定向错误信息。为此,论文提出一种评估代理(Evaluation Agent)作为中间件,结合自然语言推理(NLI)事实核查、包含加权聚合的五信号毒物检测器,以及信任指数 T = 0.4F + 0.35C + 0.25(1-P),并对高污染场景引入非线性阻尼器。在 TruthfulQA 基准上使用 Llama 3.3 70B 模型,该代理达到 91% 的准确率和 100% 的精确率,对指令注入(Instruction Injection)的召回率达到 100%;但对实体替换这类就地编辑(in-place edits)仍难以检测。在三个不同 LLM 上,信任指数保持区分度,ROC-AUC 介于 0.73 至 0.81;实验表明,生成风格比模型规模影响更大,且针对不同 LLM 校准阈值可恢复接近基线的竞争性准确率。而在较弱 FEVER 数据集上的结果则说明跨数据集泛化需要领域特定校准。在软件工程场景中,基于 OWASP Top 10 和 CWE 的安全编码助手,该代理能可靠阻止不安全建议的指令注入(F1 分数 92%),但矛盾信息与细微语义弱化仍然难以识别。研究强调,代理主要测量生成前对毒化上下文的检测能力,而非 LLM 是否实际采用了注入的错误信息。论文已发布相关方法、攻击生成器及实验工件。本文适合研究 RAG 安全、LLM 可信度评估及对抗性机器学习的读者参考。

💡 推荐理由: RAG 系统在生产环境迅速普及,但检索信任缺失导致知识投毒与误导信息风险极高。该评估代理提供了一种可落地的中间件方案,能有效检测指令注入等典型攻击,直接提升 LLM 应用的安全基线,值得安全工程师和 AI 平台团队关注。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Baixiang Liu, Haotian Che, Yuan Li

该论文提出 TrustRAG,一种基于委员会评分与区块链背书的新型检索增强生成(RAG)系统。传统 RAG 依赖集中式数据库,存在数据来源不明、内容被篡改、以及信任缺失等问题,尤其在医疗、金融、物流、法律等对信息时效性和准确性要求极高的领域,错误或被操纵的文档可能引发严重决策失误。TrustRAG 的核心思路是:文档在使用前需经过领域专家组成的委员会通过零知识协议进行认证;委员会成员对文档的隐式评分通过安全多方计算(MPC)聚合为一个可信分数,任何客户端均可验证该分数的正确性。文档数据与信任分数通过哈希承诺在跨链环境中共同维护,确保任何文档或分数都无法被静默篡改或删除,所有的排序结果都可以被独立重放和校验。该方法结合了区块链的不可篡改性和 MPC 的隐私保护特性,解决了 RAG 中文档信任与可审计性问题。实验部分(摘要未详述)预计验证了系统在文档认证效率、跨链一致性以及防篡改能力方面的有效性。该研究适合关注可信 RAG、区块链应用、数据完整性与安全审计的研究人员和工程人员阅读。

💡 推荐理由: RAG 系统在安全敏感场景中的文档可信度是实际痛点。TrustRAG 用区块链和 MPC 提供可验证的信任机制,对依赖外部知识库的 LLM 应用有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chinmay Gondhalekar, Urjitkumar Patel

该论文研究检索增强生成(RAG)在安全运营中心(SOC)分析师面向上机助手(copilot)场景中的安全漏洞。作者发现并定义了一类名为 COMA(Compositional Misleading Attack)的攻击:即使每个检索到的文档都真实、无指令注入、无矛盾,且分布上看似良性,攻击者仍可通过多个文档的“组合”效应误导模型对漏洞的评估与修复建议。COMA 包含两种具体实现:action-corruption 将已正确诊断的漏洞引导至有缺陷的修复方案;verdict-flip 通过不可判定的可达性链扰动可利用性结论。实验表明,在合成数据集及真实 CVE(CVE-2021-33813)上,action-corruption 对所有五个测试模型(包括前沿推理模型)均能成功;verdict-flip 的成攻率随模型能力增强而下降,但从未完全消失。论文提出核心原理:攻击成功的关键在于消歧事实必须被模型“推断”而非直接“读取”。针对该问题,作者提出 Causal Counterfactual Defense(CCD)审计框架,逐一衡量每个检索文档的留一法因果影响,并标记影响力集中于低信任文档的答案。在四个良性多文档对照测试中,CCD 能精确定位攻击者控制的文档且无误报;对于自适应扩散影响力的攻击者,聚合变体仍可检测。作者公开了攻击种子与 CCD 参考实现,为安全 RAG 系统提供可复现的评估与防御基线。本文适合 LLM/RAG 安全研究者、SOC 自动化工具开发者及红蓝队成员阅读。

💡 推荐理由: RAG 系统在 SOC 中的普及使该攻击具有直接现实威胁:即使检索内容全部真实,攻击者仍能诱导安全助手下错误结论,可能导致真实漏洞未修复或修复不充分。CCD 防御提供可部署的审计思路,对构建可信安全 copilot 至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

本文提出了一种名为拓扑归因距离(Topological Attribution Distance, TAD)的新方法,用于解决大语言模型(LLM)在网络安全运营中输出证据归因与溯源的问题。随着LLM和Agentic AI被集成到安全运维系统中,模型生成的决策必须可信任、可追溯;当自主智能体做出正确或错误决策时,团队需要能够回溯决策链,定位究竟是哪一段输入数据导致了模型输出。现有归因方法在区分复杂且高度相似的证据源(如网络事件日志)时存在困难,无法充分捕捉检索证据与生成响应之间的整体几何关系。TAD受拓扑学启发,通过刻画模型输出在嵌入空间中的全局几何形状,并测量特定日志嵌入改变该几何形状的程度,来判断该日志是否为关键归因源。该方法采用段级消融归因(segment-level ablation attribution),对真实网络攻击事件日志进行分析,能够自适应地找出对LLM输出影响最大的日志片段。TAD利用每个LLM的隐藏状态,提供可解释、可信任的溯源能力,帮助理解几何上不同的检索日志如何影响模型生成,为网络安全和Agentic-AI工作流提供证据验证手段。实验部分展示了TAD在实际攻击日志上的有效性,表明其能准确识别关键归因日志。本文的主要贡献包括:提出基于拓扑的归因距离度量,引入段级消融归因机制,以及将几何形状变化与证据溯源相结合,弥补现有方法在复杂相似证据区分和全局几何关系捕捉上的不足。适合AI安全研究人员、LLM可解释性研究者、以及负责安全运营自动化的工程师阅读。

💡 推荐理由: 该研究为LLM输出提供了可解释的溯源方法,帮助安全团队定位导致模型决策的关键日志,增强Agentic AI在安全运营中的可信度,对证据验证和事件调查有直接价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Chang Liu, Yuni Lai, Mingyue Cui, Cong Tian, Yunyan Zhang, Xian Wu, Kai Zhou, Bin Xiao

多模态检索增强生成(M-RAG)系统正面临一类对抗性攻击:攻击者精心构造恶意数据,使其嵌入向量在向量空间中与良性条目对齐,从而欺骗检索器、诱导模型产生有害输出。现有防御大多在查询阶段运行,依赖辅助检测器、相似度重排序或特征一致性校验,但存在推理开销大、对未见攻击泛化差、且常假设特定攻击分布等缺陷。为此,本文提出 DSPrompt(Dynamic Soft Prompt)防御框架,直接重塑检索器的嵌入语义而不修改检索流程。该方法在冻结的检索器视觉和文本编码器的每一层插入少量可学习软提示,并采用由浅入深的自适应长度调度,以匹配各模型层的容量。软提示通过动态最小-最大博弈训练:一个在线多模态攻击者持续针对当前检索器构造困难对抗文档,而防御者更新参数使这类文档被挤出 top-k 检索结果,同时保留良性证据的排序与多样性。由于防御后的编码器可像标准密集检索一样预计算并建立索引,DSPrompt 无需任何额外逐查询优化,且新增参数少于 1%。在四个基准数据集和三种代表性投毒攻击上的大量实验表明,DSPrompt 显著降低了攻击成功率和投毒检索率,同时保持近乎无损的检索效用和生成保真度,在仅需基线一小部分计算成本的情况下持续优于现有防御方案。

💡 推荐理由: 多模态 RAG 正成为关键应用,但其检索环节易被嵌入投毒攻击。DSPrompt 提供了一种无额外查询开销、参数高效且可预计算的防御思路,对构建鲁棒 RAG 系统有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Prashant Kumar Pathak, Tarun Kumar Sharma

本文研究检索增强生成(RAG)系统中的投毒攻击与防御局限。RAG 通过从向量库检索段落作为上下文来回答问题,因此任何能够添加文档的人都有可能操纵答案。一种近期的防御方案是在文档摄入时进行过滤,拒绝任何行为类似“枢纽”的文档。作者证明这种过滤以及所有摄入时防御都会被一种协调攻击者击败:攻击者注入少量单独看起来无异常的文档,这些文档共同围绕一个目标查询并占据其 top-k 结果。在 BGE-large / BEIR 数据集上,仅需 10 个文档即可在 10/10 的目标上成功,在实时 HNSW 索引上为 9.9/10。该攻击并非纯理论,而是实现为普通流畅文本,并通过 BGE-large + HNSW + Qwen2.5-7B 流水线进行端到端运行,使生成器在 88% 的目标中输出攻击者植入的声明,而无不投毒时为 0%。此外,任何摄入时防御都无法阻止该攻击:在摄入时,攻击锥在几何上与合法利基上传相同,作者直接测量发现,即使给定所有特征和数千个示例,最强的训练分类器区分两者也不优于随机猜测(在 1% 假阳性率下仅捕获 4.2% 的攻击)。作者证明这一局限适用于所有摄入时统计量(仅从文档和参考查询做出任何决策),并在两个语料库和五个编码器上重复出现,且效果恶化。唯一能区分攻击与合法利基摄入的信号——查询需求——在检索前不可见,这也提供了逃逸途径:观察需求的检索时检测器在相同的 1% 假阳性率下能够捕获 100% 的攻击。结论是:摄入门禁对查询空间的覆盖并不等同于对协调投毒的遏制;稳健防御必须超越前门,转向需求侧。本文适合安全研究人员、RAG 系统开发者以及关注 AI 供应链安全的从业者阅读。

💡 推荐理由: 该研究揭示了 RAG 系统摄入时安全机制的认知盲区,证明基于文档特征的过滤无法防御协调投毒,对依赖向量检索的 AI 应用安全设计有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinlong Xu, Yoshua Y. Li

检索增强生成(RAG)将外部语料库作为推理证据,但这也引入了安全风险:攻击者可通过注入恶意文档(知识投毒)来引导模型输出特定主张。现有检测方法通常依赖可信参考文档、特定攻击痕迹或全局阈值,这些方法在复杂语料拓扑下鲁棒性不足。本文提出 RAGSieve,一种自参考的检测框架,它通过从被检查的 RAG 系统自身构造参考,无需外部可信语料或投毒标签即可进行检测。RAGSieve 包含两个互补组件:RSQ(查询侧)在用户发起查询时工作,通过对比同一检索中前5个候选与排名6-20的结果,捕捉答案锚点集中与载体转移等异常;RSG(语料侧)在查询之前工作,将每篇文档与其语义相似但词汇不同的邻居进行比较,以识别协调性投毒密度。实验在三个问答数据集和六种投毒构造上进行,RSQ 的 AUROC 达95.2%,在移除5%干净文档时检测出82.2%的毒物,显著优于基线 GMTP(81.1%/52.5%);RSG 达93.3%/79.8%,优于 CleanBase(79.4%/37.6%)。联合使用两者可将攻击成功率从67.4%降至14.0%,同时在未投毒检索上保持41.3%的F1分数,说明该方法能在语料入库和查询阶段提供实际防护。该研究适合关注 LLM 供应链安全、检索系统可靠性的安全研究人员与 AI 安全工程师阅读。

💡 推荐理由: RAG 系统日益普及,但知识投毒攻击严重威胁其输出可靠性。现有检测方法依赖可信参考或全局阈值,难以应对多样化的投毒策略。RAGSieve 利用系统自身局部对比,无需外部信任假设,即可同时检测查询时和索引时的威胁,显著降低攻击成功率,为防御方提供了实用且鲁棒的检测框架。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Saleh Almohaimeed, Saad Almohaimeed, Mousa Jari, Fahad Alotaibi, Khalid A. Alobaid

本文提出了一种面向检索增强生成(RAG)场景的隐私保护框架 SEAG(Sensitive Entity Alias Generator),旨在解决外部大语言模型(LLM)在生成回答时可能接触用户查询和检索文档中的敏感信息这一常被忽视的问题。现有 RAG 隐私研究主要关注防止未授权用户访问敏感数据,但本文指出,当 RAG 调用第三方生成器时,查询和检索文档会明文暴露给外部模型,存在敏感信息被滥用或用于非预期目的的风险。SEAG 框架包含一个轻量级模型,能够定位查询和文档中的敏感实体(如人名、地名、组织、身份证号等),为每个敏感实体生成对应的别名,并构建实体替换表。在将查询和文档发送给外部生成器之前,SEAG 使用该替换表对敏感词进行替换,从而隐藏真实敏感信息,同时尽可能保留语义以便生成器输出正确回答。作者构建了两个数据集:一个用于微调 SEAG 模型以生成实体替换表,另一个用于评估整个框架。实验表明,SEAG 在“用户指标”(衡量模型在向用户提供正确回答的同时向外部生成器隐藏敏感信息的能力)上,所有 SEAG 模型均达到超过 80% 的准确率。进一步分析评估了 Qwen-3、LLaMA-3.2 和 Phi-4 三个 SEAG 模型隐藏给定文档中全部敏感实体的能力,总准确率分别为 77.83%、76.73% 和 74.91%,表现良好。该研究为 RAG 系统中的隐私保护提供了一种实用的预处理方案,适合关注 RAG 隐私、数据脱敏和第三方 LLM 安全使用的安全研究人员与工程师阅读。

💡 推荐理由: RAG 系统常调用第三方 LLM,查询与检索文档中的敏感信息可能被外部模型获取,造成隐私泄露。SEAG 提出的实体别名校验机制可在不影响回答质量的前提下隐藏敏感实体,为蓝队设计数据脱敏策略提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yanhang Li, Zhichao Fan, Zexin Zhuang

该论文针对检索增强生成(RAG)系统中的隐私防御措施提出了一种基于源码的主动路径审计方法论。研究指出,黑盒隐私分数难以解释,除非明确被审计防御机制在系统管线中的实际挂钩点。为此,作者提出了主动路径审计方法:首先对检索、检索内容处理以及生成三个阶段进行源码级挂钩清单梳理,将每个隐私指标映射到其对应的泄漏通道,并使用精确匹配的诱饵数据(canaries)验证生成文本的实际隐私泄漏。作者在自己实现的多个基准防御方案上进行了案例研究。结果显示,基于差分隐私(DP)风格的防御方法仅修改了检索评分,其生成阶段的挂钩是TODO标记的占位存根,即未对生成结果做任何改动。这一主动路径解释了为何这些DP式方法会影响成员推断攻击行为,但在命名实体泄漏严格指标(NEL_strict)上却与无防御基线相同。相比之下,端到端的LPRAG方案在电子邮件通道上通过了诱饵验证,在无防御情况下能恢复53/150个诱饵,而应用LPRAG后恢复数为0/150。作者强调,这些发现仅涉及其在自己技术栈上的重实现,不构成对已发布防御方案或防御家族的普适性排名,其核心贡献是提供了一套审计方法论和案例研究,而非给出通用结论。

💡 推荐理由: RAG系统在隐私场景中部署广泛,但现有隐私防御评估常忽略管线中的实际介入点。本文提供了一种从源码端审计防御有效性的方法,帮助防御者辨别哪些隐私指标是真实有效、哪些只是表面改动,避免被虚假的安全感误导。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kaysarul Anas Apurba, Md. Hasibul Hasan, Mahedee Zaman Moon, Sk. Md. Mizanur Rahman, Atsuo Inomata

检索增强生成(RAG)技术通过从向量知识库中检索语义相似的历史流量,使大语言模型能够对网络流进行分类并生成可读的入侵事件报告。然而,检索层的引入同时带来了知识投毒和提示注入等安全漏洞。本文提出 RAG-IDS,一个三层多智能体入侵检测框架,并设计了一种检索边界防御机制,结合软信任评分(soft trust scoring)、标签嵌入一致性检查(LECC)和提示清理(prompt sanitization),旨在检索层遭受攻击时恢复分类质量。作者在 CIC-UNSW-NB15 数据集上进行了实验,结果表明:在 1% 投毒比例下,防御后的性能恢复率 R=1.0(相对于未受攻击的干净基线),即使在 30% 投毒比例下仍能保持 R=0.57,且对干净性能带来的开销可忽略不计。针对提示注入攻击,多文档检索机制将标签翻转成功率限制在 0.6-2.4%,而单文档检索的失败率则高达 35-55%。消融实验显示,LECC 是鲁棒性的主要贡献者,而基于软信任的降级策略优于硬过滤。防御后的 RAG 流水线为入侵检测提供了可解释、抗攻击的基础,适合与高通量分类器混合部署。本文的主要贡献在于系统性地分析了 RAG 在入侵检测场景下的检索层攻击面,提出了组合式防御架构,并通过实验验证了各防御组件的有效性。适合从事 LLM 安全、入侵检测和 AI 系统防御的研究人员与安全工程师阅读。

💡 推荐理由: RAG 正被用于构建可解释的入侵检测系统,但检索层引入的新攻击面可能被利用。本文给出了经过实验验证的防御方法,对蓝队设计安全的 LLM 驱动安全工具具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xi Nie, Hongwei Li, Shenghao Wu, Wenshu Fan, Qiyang Song, Wenbo Jiang

本文针对检索增强生成(RAG)系统中证据冲突这一根本性挑战,提出了一种新的研究问题——冲突来源归因(conflict origin attribution),并设计了无训练框架 EvoTrustRAG。在动态和对抗性环境中,同一冲突可能源自合法的知识演化、恶意操纵或尚未解决的不确定性,而现有方法通常将冲突视为静态不一致,仅选择更可靠的知识,忽略了冲突的演化属性。EvoTrustRAG 在答案生成之前,将基于跨度(span)的检索事实建模为冲突证据图,利用时间关系、支持结构和辅助一致性评估 grounded evolution(基于证据的演化)与方向性干预假设,并将局部决策投影为全局一致的冲突组解释。该归因过程决定早期与后期状态是保留为时间知识、将干预候选与主要上下文分离,还是作为未解决冲突保持可见供生成器参考。与基于溯源(provenance)的事后分析方法不同,EvoTrustRAG 在推理阶段即可判断冲突证据是否遵循合理的知识演化、是否呈现类似干预的支持结构,或无法可靠归因。实验表明,EvoTrustRAG 在基准原生冲突设置上平均准确率达 81.4%,将归因宏 F1 比最强基线提升 7 个百分点(72.2% → 79.1%),并在最强协同攻击下将错误率从 31.2% 降至 16.0%。该工作为 RAG 的鲁棒性提供了一种不依赖微调、可在推理时动态处理冲突的通用方法,适合关注大模型安全、对抗鲁棒性与信息可信度的研究人员和工程团队阅读。

💡 推荐理由: 该文首次将冲突归因作为独立问题引入 RAG,使系统不只选答案,还能识别冲突是演化、干预还是未决,对对抗性检索场景的防御设计有直接启发。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yingtao Ren, Ziyi Zhao, Yiwei Fu, Xiao Luo, Yu-Cheng Chang, Chin-Teng Lin

本文针对检索增强生成(RAG)系统面临的投毒攻击威胁,提出了一种基于文档级注意力坍缩(Attention Collapse)的检测方法。RAG通过注入外部文档来增强大语言模型的生成能力,但攻击者可能注入对抗性文档以操纵模型输出。现有检测方法主要依赖输出侧信号,如困惑度(perplexity)和一致性检查,但作者分析发现,经过精心设计的攻击往往诱导模型产生虚假的自信,受污染输出的困惑度甚至低于良性输出,使得基于不确定性的检测方法失效。为此,作者转向研究生成器内部注意力动态,发现攻击会导致一种独特的信号——注意力坍缩:良性生成中的注意力通常分散,而受攻击生成中注意力集中到被污染的文档,从而使注意力熵降低。基于这一发现,作者提出了轻量级检测框架D-SCAN(Document-level Signal Collapse Analysis),通过监控注意力动态来识别被攻击的生成结果。在多个攻击基准上的大量实验验证了该方法的有效性,并且D-SCAN甚至能检测到最终答案未被改变的攻击(即攻击不成功但仍有恶意意图的情况)。代码已开源。该研究为RAG安全提供了新的内部信号检测视角,适合从事LLM安全、红队和防御研究的人员阅读。

💡 推荐理由: RAG投毒攻击是当前LLM应用的主要威胁之一,现有基于输出困惑度和一致性的检测手段容易被对抗样本绕过。本文首次利用内部注意力坍缩信号进行检测,为防御方提供了不依赖最终答案的早期预警能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zijian Wang, Yubo Zhu, Muzhi Dong, Yanjun Lou, Yisheng Li, ZiLiang Zhang, Wei Tong, Yuan Zhang, Jingyu Hua, Sheng Zhong

本文研究检索增强生成(RAG)系统中后检索冲突消解机制对知识投毒的鲁棒性。现有黑盒投毒攻击通常以正面反驳的方式直接断言目标答案,与冲突消解器视为'已定事实'的参考信号形成明显矛盾,因此容易被检测。作者提出一种名为 PURPOSE 的严格黑盒投毒攻击方法,将注入内容重新定义为一种'最小化冲突的更新',而非对抗性反驳。PURPOSE 首先从查询中提取与消解器可能参考事实相关的命题,然后以这些事实为锚点构造一个'代理事实'作为事件支撑,使注入内容与消解器可能验证的信息保持一致,同时引导生成器输出目标答案。实验基于三个问答基准、五个生成器和三种冲突消解方法,PURPOSE 在 45 种设置中的 35 种取得最高攻击成功率(ASR),相比最强的先前攻击平均 ASR 提升 9.7 个百分点。结果表明,非矛盾式注入是增强 RAG 投毒攻击的一种实用模式,并揭示现有冲突消解机制在面对一致性投毒时的脆弱性。适合关注大模型安全、RAG 系统可信性和对抗性机器学习的蓝队研究人员与安全工程师阅读。

💡 推荐理由: 揭示 RAG 中看似合理的冲突消解机制仍可被巧妙投毒利用,攻击者无需白盒信息即可实现高成功率,威胁企业级 RAG 应用的输出可信性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

本文针对检索增强生成(RAG)系统在大型语言模型(LLM)应用中面临的知识污染攻击问题,提出了一种名为 SecureCollaRAG 的拜占庭容错协作式 RAG 框架。研究背景是:虽然 RAG 能够缓解 LLM 的幻觉问题,但攻击者可通过投毒外部文档来操纵 LLM 输出,形成新的安全漏洞。为应对这一威胁,作者引入多源知识验证机制(Multi-source Knowledge Validation Mechanism),使智能体系统能够通过基于动态图神经网络(GNN)的可信度评分来安全地验证文档来源,从而有效防御隐蔽的知识污染攻击,同时保留关键领域知识的完整性。论文通过大量实验和形式化分析证明,SecureCollaRAG 在非独立同分布(non-IID)数据分布下仍能保持对攻击者的鲁棒性。核心贡献包括:提出针对 RAG 知识污染威胁的拜占庭容错协作框架、设计动态 GNN 驱动的文档可信度评估方法、以及提供形式化安全性分析。适合关注 LLM 安全、智能体安全、RAG 系统防御的研究人员和安全工程师阅读。

💡 推荐理由: RAG 已被广泛用于 LLM 应用,但知识投毒攻击可悄无声息地操纵模型输出。SecureCollaRAG 提出一种基于多源验证和 GNN 可信度评分的防御思路,为构建健壮的智能体知识管道提供了新方向。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Abay Zhurekbay, Tao Liu, Fan Li

本文研究检索增强生成(RAG)系统面临的数据投毒威胁。作者指出,已有单文档投毒攻击通常避免在恶意文档中显式提及正确回答,而是采用间接方式误导。DenialRAG 则采用相反策略:在投毒文档中直接写明正确回答,然后明确否定该回答,并附加一个看似合理的错误解释,从而在检索结果被生成器阅读时,将矛盾直接嵌入上下文。通过这种方式,攻击者可以操纵模型输出错误答案。为了验证有效性,作者在三个开放域问答数据集上,将 DenialRAG 与四种已发表的单文档投毒攻击对比,测试了来自四个厂商的八个目标大语言模型,并评估五种推理时防御机制。实验显示,攻击成功率高度依赖目标模型:DenialRAG 在所有 Mistral-7B 数据集上取得最高成功率,部分其他模型上也表现良好,但某些模型上其他攻击更优。防御措施能够降低成功率,但无法完全消除,且不同防御对不同模型效果不一。组件级分析表明,嵌入式拒绝(denial)是影响攻击效果的最关键组件;跨模型分析显示不同投毒机制在不同模型族上失效速度不同。作者总结,RAG 投毒风险不能由单一攻击家族或单一目标模型来刻画,需要多维度评估。

💡 推荐理由: RAG 系统在企业 AI 应用中日益普及,语料库投毒可导致模型输出被定向篡改,威胁信息可信度。DenialRAG 揭示了即使显式提及正确答案也能成功误导模型的攻击方式,提示防御方需综合考虑文档内部冲突与模型自身鲁棒性,而非仅依赖简单过滤。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ali Naseh, Yuefeng Peng, Anshuman Suri, Harsh Chaudhari, Alina Oprea, Amir Houmansadr

本文研究检索增强生成(RAG)系统中的成员推断攻击(Membership Inference Attack, MIA)问题。RAG 通过将外部知识库中的文档检索结果注入到大语言模型的上下文中,实现无需调整模型参数的接地生成。尽管不更新权重避免了通过模型参数泄露训练数据,但检索到的文档本身可能被攻击者利用,构成新的隐私泄露面。已有的成员推断和数据提取方法通常依赖越狱提示或精心构造的非自然查询,容易被 RAG 系统中常见的查询改写技术检测或拦截。为此,作者提出一种名为“审讯攻击”(Interrogation Attack, IA)的新型成员推断技术,专门针对 RAG 数据存储中的目标文档。其核心思想是构造自然语言查询,使得只有目标文档出现在上下文中时该查询才能被正确回答,从而以黑盒方式推断文档是否在数据库中。实验表明,该攻击仅需 30 次查询即可完成单文档推断,且隐蔽性显著优于现有方法:常规检测器对已有攻击生成的对抗提示的识别频率是对 IA 生成提示的约 76 倍。在多种 RAG 配置下,IA 在 1% 假阳性率下的真阳性率(TPR@1%FPR)相比先前推断攻击提升 2 倍,而单文档推断成本低于 0.02 美元。该研究揭示了 RAG 系统中“通过上下文泄露”的新隐私风险,凸显了检索端防御的重要性。适合关注 LLM 隐私、RAG 安全及对抗机器学习的蓝队研究人员阅读。

💡 推荐理由: RAG 已成为企业级 LLM 应用的标配,本文首次展示了仅用自然查询即可对文档库进行高隐蔽性成员推断,成本极低,威胁到机密数据库的保密性,蓝队需重视检索环节的隐私风险。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li

该论文提出了一种针对检索增强生成(RAG)系统数据投毒攻击的分层防御框架 RAGuard。RAG 系统通过检索外部语料库来增强大语言模型(LLM)的回答,但这种依赖也引入了安全风险:攻击者可以向语料库中注入精心设计的恶意文本片段,从而操纵检索结果并影响模型生成内容。论文聚焦于“事实性”语料投毒攻击,即注入包含虚构事实、矛盾信息或推理陷阱的文本。RAGuard 包含两层防御:第一层是对稠密检索器进行对抗性微调。研究者使用合成的投毒文档(包含伪造事实、矛盾和推理陷阱)微调检索器,使其学会在生成之前降低恶意片段的排序。第二层是零知识推理补丁(ZKIP),这是一种基于黑盒模型的无需标签的过滤器。对于每个检索到的文档,ZKIP 通过逐一排除(leave-one-out)解码方式,比较在有无该文档的情况下模型回答的语义偏移和输出熵变化,从而评估该文档对答案的影响。ZKIP 不依赖投毒标签、标准答案或模型内部权重,仅需对比模型在反事实上下文下的输出。在自然问答数据集(Natural Questions)上,投毒比例从 5% 到 30% 的实验中,仅进行对抗性检索器训练可以降低攻击成功率但仍无法根除;而加入 ZKIP 后,在所有被测试的防御配置下,攻击成功率均降至 0.000,同时将召回率(Recall@5)保持在干净语料库基线的 0.03 以内。此外,在 BEIR 的 NFCorpus 子集上的监督分析验证了 ZKIP 所依赖的反事实信号具有可学习的投毒结构。防御带来的开销是每个查询需要 k+1 次生成器推理(k=5 时为 6 倍),论文分析了批处理和提前停止等近似方法来减少开销。作者还指出,保留关键字的投毒方法几乎不影响基于词法的检索器(如 BM25),这界定了威胁模型的范围。为便于复现,论文公开了代码、数据集和评估框架。

💡 推荐理由: 针对 RAG 数据投毒攻击提供了分层防御方案,无需修改生成模型,且 ZKIP 黑盒特性易于集成。实验证明可将攻击成功率降至 0,同时保持检索质量,对构建可信 RAG 系统具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

本文研究了针对网络增强型大语言模型(LLM)推荐系统的对抗性排名操纵问题。当LLM通过检索和阅读实时网页来回答推荐查询时,它扮演了推荐系统的角色,每个检索到的页面都可能成为攻击面。现有工作主要关注虚构产品、检索投毒和排名提升,但未系统比较在保持周围源集不变的情况下,对已检索页面进行不同编辑如何改变模型的最终排名。为填补这一空白,作者提出了SIREN方法,这是一种自动化的攻击者-裁判方法,将PAIR越狱循环适配为竞争性排名操纵,目标是将选定实体提升至LLM生成的推荐列表的第一位。SIREN使用Anthropic网络工具检索和捕获网页,然后通过23种内容投毒技术的可解释分类法迭代编辑检索到的源。其自定义RAG重放平台保持源顺序不变,从而将模型排名的变化归因于内容变化而非检索差异。在两个生产级Claude模型上,SIREN在8个查询-模型上下文的124次技术试验中,有62次成功将目标推至第一位。达到第一位的载荷在全新会话中测试,平均成功率为0.805。在评估的各种设置中,声明性排名声明和种子列表通常比指令式注入更有效,但效果差异取决于目标模型。据作者所知,这是首个在保持源上下文不变的情况下,针对生产级LLM进行竞争性排名操纵的受控研究。

💡 推荐理由: 该研究揭示了LLM推荐系统易受内容投毒攻击的脆弱性,攻击者可通过操纵已检索网页内容影响排名结果,对依赖LLM推荐的应用(如搜索引擎、产品推荐)构成实质性威胁。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Daekwon Pi, Sangho Lee, Young Hun Lee, Huy Kang Kim

该研究针对现代车辆网络安全中,现有的自动化工具有效处理非结构化网络威胁情报(CTI)不足的问题,提出GARAGE框架。GARAGE基于检索增强生成(RAG),将碎片化的CTI转化为符合STIX 2.1和Auto-ISAC ATM标准的结构化知识库,用于自动生成攻击图。框架整合了12,786个CVE和140个事件报告,通过细粒度杀伤链分析形式化战术模式场景,实现了威胁生成能力。通过320次留一实验,验证了GARAGE能准确地将安全知识迁移到完全未见的车辆架构上。此外,GARAGE被定位为人机协同工作流中的可扩展TARA支持工具,并提供了跨多种LLM层级的成本-性能分析以指导部署。主要贡献在于提出了一个结合RAG与领域知识的自动化攻击图生成方法,有效解决了汽车CTI的异构性和架构特异问题。

💡 推荐理由: 为汽车安全分析师提供了一种从非结构化CTI自动生成攻击图的方法,显著提升威胁建模效率,尤其适合TARA评估场景。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xingfu Zhou, Pengfei Wang, Yuan Zhou, Wei Xie, Xu Zhou

本文研究基于代理的检索增强生成(RAG)系统在多跳问答中的安全威胁。现有防御主要关注内容投毒(注入虚假事实)和提示注入(嵌入指令)。作者发现第三个攻击面:显著性通道(salience channel),即通过调整事实的位置、强调方式、框架和语义邻近性,可以重定向模型的推理路径,即使所有检索到的信息都是真实的且没有注入指令。作者将这种攻击形式化为显著性诱导(Salience Induction):保持事实真实性但通过编辑改变多跳属性绑定,同时保持检索痕迹语义完整。定义了六类显著性编辑算子,并构建了迭代的提议-验证流水线,满足事实性和隐蔽性约束。还创建了带干扰注释的多跳基准SalientWiki-MH。在五个前沿模型家族(GPT、Claude、Gemini、DeepSeek、Qwen)和三种代理架构(ReAct、Reflexion、tool-calling)上进行评估,在30%编辑预算下,攻击成功率达83.3%;最强的基线防御后仍然有75.7%的攻击成功率。未经目标导向的重写仅通过降低中性任务成功率来减少攻击。本文提出的轻量级输入侧防御——显著性归一化(Salience Normalization),可将攻击成功率降至15.3%(标准攻击)和23.6%(自适应攻击)。结果表明,仅依赖真实性和指令过滤是不够的;鲁棒的RAG代理还需要防御显著性-相关性解耦攻击。

💡 推荐理由: 揭示了RAG系统的新攻击面,即通过操纵事实的显著性而非内容本身来误导模型,现有防御措施对此无效,对构建安全可靠的代理系统具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Avital Shafran, Roei Schuster, Vitaly Shmatikov

检索增强生成(RAG)系统通过从知识数据库中检索相关文档,并利用大型语言模型(LLM)处理这些文档来回答查询。本文发现,当RAG系统操作包含不可信内容的数据库时,容易受到一种称为“jamming”的拒绝服务攻击。攻击者可以向数据库中添加单个“blocker”文档,该文档会在特定查询时被检索,导致RAG系统无法回答该查询,表面上是因为缺乏相关信息或回答不安全。作者描述并测量了多种生成blocker文档的方法,包括一种基于黑盒优化的新方法。该方法(1)不依赖于指令注入,(2)不需要攻击者了解目标RAG系统使用的嵌入或LLM,以及(3)不使用辅助LLM。作者在多种嵌入和LLM上评估了jamming攻击,并证明现有的LLM安全指标无法捕捉其对jamming的脆弱性。最后,讨论了针对blocker文档的防御措施。本文的核心贡献在于揭示并量化了RAG系统在面对恶意文档时的拒绝服务风险,提出了一种通用的攻击生成方法,并对现有安全评估的不足进行了批判。

💡 推荐理由: RAG系统广泛应用于企业知识库和问答服务,本文揭示的jamming攻击可导致关键功能拒绝服务,且攻击者无需特殊权限或了解内部模型,实际威胁较大。现有安全指标未能有效预警,需引起防御者重视。

🎯 建议动作: 研究跟进:评估使用的RAG系统是否易受jamming攻击,并参考论文中讨论的防御策略进行加固

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gang Zhang, Mingyu Tian, Xukun Luan, Yuanchi Ma, Jinyan Liu

检索增强生成(RAG)通过外部文档检索增强大型语言模型的能力,但检索到的上下文可能泄露敏感信息。现有隐私保护方法通常基于文档级静态风险假设,即认为所有检索文档具有相同的隐私泄露风险。然而,这一假设忽略了RAG的一个基本特征:文档的隐私风险高度依赖于用户的查询,使得隐私泄露本质上是查询驱动的、动态的。为了解决这一挑战,本文提出了一种用于隐私保护RAG的提示感知动态层次差分隐私框架(PA-HDP)。PA-HDP首先执行提示感知的风险层次划分,动态评估不同查询下的隐私风险;然后应用自适应敏感实体替换和基于指数机制的文本选择,在保留语义效用的同时提供差异化的隐私保护。通过仅保护给定查询下真正敏感的内容,PA-HDP最小化了对检索语料库的不必要修改。在基准数据集上的大量实验表明,PA-HDP在保持高检索质量的同时显著降低了隐私泄露,实现了比先前方法更好的隐私-效用权衡。本文适用于对RAG隐私保护、差分隐私、以及大语言模型安全感兴趣的研究人员和工程师。

💡 推荐理由: 首次明确提出RAG中隐私风险的查询依赖性,并设计动态保护机制,突破静态假设局限,对提升RAG系统实际部署中的隐私安全性具有重要参考价值。

🎯 建议动作: 研究跟进:深入阅读论文,评估其在自身RAG场景中的适用性,并考虑集成动态隐私风险评估机制。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Om Solanki, Lopamudra Praharaj, Deepti Gupta, Maanak Gupta

本文针对面向战场物联网(IoBT)任务控制的策略感知大语言模型检索增强生成(PA-LLM-RAG)框架,首次系统研究了知识库投毒攻击及其防御。作者提出了一种新颖的“查询无关语义检索投毒”(Query-Agnostic Semantic Retrieval Poisoning)攻击方法,该方法向IoBT知识库中注入精心构造的语义规则,无需知道运行时用户提示即可在所有操作员查询类型上获得高检索排名。实验表明,单条注入规则(投毒率仅1.6%)即可实现85%的LLM上下文污染,投毒率饱和点为7.7%,证明即使极小的知识库破坏也足以篡改任务决策。为应对此威胁,作者提出了CLD-KB(基于网络分层防御的知识库保护)框架,一种双重检测器异常检测方案,结合One-Class SVM边界检测和创新的“基于成员的类别扩散分析”(Member-Based Category Spread analysis),利用IoBT策略的三分类体系,在决策LLM之前识别被投毒的规则。CLD-KB在投毒检测和知识保留上显著优于DBSCAN、LOF、K-Means、孤立森林和One-Class SVM五种基线方法,每次任务仅增加7ms计算开销,证明其作为LLM驱动的IoBT任务系统中高效、可边缘部署的防御方案的有效性。该研究揭示了RAG系统在关键领域的独特安全漏洞,并提供了实用的防御思路。

💡 推荐理由: 首次系统研究面向RAG知识库的语义投毒攻击,揭示低投毒率即可实现高污染率的关键威胁,并提出轻量级可边缘部署的双重检测防御,对LLM在关键任务场景(如军事、医疗)的安全落地有重要警示意义。

🎯 建议动作: 纳入内部评估:建议AI安全团队在自研RAG系统或采购LLM服务时,测试知识库投毒攻击的影响,并评估CLD-KB防御的适用性。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chanwoo Choi, Euntae Kim, Kyuho Lee, Youngsam Chun, Jinhee Jeong, Eunmi Kim, Myunggyo Oh, Junseo Jang, Buru Chang

检索增强生成(RAG)系统容易受到投毒攻击,攻击者通过注入恶意文档来操纵模型输出。近期出现的智能体RAG(Agentic RAG)系统通过迭代执行检索与推理,能够忽略弱相关的投毒文档并保持由用户查询引发的推理链,从而对此类攻击表现出更强的鲁棒性。然而,现有针对智能体RAG系统的攻击通常假设白盒访问系统提示、推理轨迹、检索器或模型参数,这限制了它们在现实场景中的适用性。本文研究了针对智能体RAG系统的黑盒投毒攻击,即攻击者仅能发布可被外部检索的投毒文档。作者提出了KidnapRAG,一种顺序投毒攻击方法,利用三种角色特定的文档劫持智能体的多步推理链:Bait文档用于吸引初始检索,Chain-Link文档诱导查询重构,Mal-Ins文档提供攻击者控制的证据。在多种智能体RAG框架、LLM后端和基准测试上的实验表明,KidnapRAG在黑盒条件下持续优于现有的投毒基线。进一步的分析显示,KidnapRAG逐步削弱原始检索意图,重定向检索行为,并增加对攻击者控制证据的依赖。该研究的核心贡献在于:首次系统性地探索了针对智能体RAG系统的黑盒投毒攻击;提出了一个高效的顺序攻击框架;通过实验验证了其有效性并分析了攻击机理。代码已开源。该研究对RAG系统的安全性提出了新的挑战,提醒开发者注意智能体推理链的脆弱性,并考虑设计更鲁棒的防御机制。

💡 推荐理由: KidnapRAG首次揭示了智能体RAG系统在黑盒场景下仍易受投毒攻击,打破了此类系统更鲁棒的普遍认知。它不依赖系统内部信息,仅通过发布恶意文档即可劫持推理链,严重威胁依赖RAG的LLM应用安全,如客服、问答系统等。

🎯 建议动作: 研究跟进,建议开发针对投毒文档的检测与过滤机制,或在推理链中引入验证步骤。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

该论文针对检索增强生成(RAG)系统面临的语料库投毒攻击问题,提出了一种轻量级检测框架TRACE。RAG系统通过检索外部文档来增强大语言模型的生成能力,但攻击者可向检索库中注入恶意文档,诱导模型输出特定目标答案。现有检测方法通常依赖额外的分类器或基于LLM的验证,计算开销较大。TRACE通过令牌影响归因(token influence attribution)来识别投毒攻击:首先在所有检索到的文档中寻找具有高影响力的重复关键词(recurrent high-influence keywords),这些关键词可能是攻击者植入的触发词;然后进行二次验证,确认这些关键词对模型预测的实质性影响。该方法无需训练辅助模型或调用外部LLM,仅需分析模型内部的梯度或注意力信号。实验在三个问答基准数据集(如Natural Questions、TriviaQA等)和六个主流LLM(包括GPT系列、LLaMA等)上进行,结果表明TRACE能够有效检测投毒攻击,且计算开销远低于对比方法。此外,TRACE还能揭示攻击者指定的目标答案,为后续防御提供线索。该工作为RAG系统的安全性提供了一种实用且高效的检测方案。

💡 推荐理由: RAG系统在工业界广泛部署,语料库投毒攻击威胁其可信输出。TRACE提供了一种轻量级、无需额外模型的检测方法,可集成到现有流水线中,提升安全水位。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Balamurugan Palanisamy, G S S Chalapathi, Vikas Hassija, Rajkumar Buyya

本文是一篇关于检索增强生成(RAG)系统安全与隐私的综合性综述。RAG通过将外部知识库与大型语言模型结合,显著提升了事实性和适应性,但也引入了传统语言模型威胁之外的新风险。论文首先介绍了RAG的典型架构,包括集中式、设备端(Micro-RAG)、联邦式和混合式部署范式,并系统梳理了检索、上下文构建和生成三个阶段的安全威胁面。威胁分类涵盖了成员推断、索引推断、投毒攻击、梯度泄露和合谋攻击等。在防御方面,论文分析了架构、算法和密码学防御手段,并讨论了隐私-效用权衡及部署考虑。最后,论文指出了构建可信RAG系统的开放研究挑战。该综述适合安全研究员、AI从业者和系统设计者阅读,以全面理解RAG特有的风险及防御策略。

💡 推荐理由: RAG系统正被广泛应用于企业搜索、问答机器人等场景,但检索与生成组件的耦合引入了新型攻击面。本文首次系统化该领域的威胁与防御,有助于蓝队提前识别风险并设计安全架构。

🎯 建议动作: 阅读全文以获取威胁分类与防御技术细节,并评估自身RAG系统的风险暴露。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Juho Park, Hyunmin Choi, Kevin Nam

本文研究了针对基于检索增强生成(RAG)的AI安全代理的知识投毒攻击。随着安全代理越来越多地依赖RAG从外部知识源(如CVE报告、CTF write-ups)获取漏洞分析和利用推理信息,攻击者可以通过注入恶意构造的write-up(称为Poisoned Playbooks)来操控代理的行为。作者在11个CTF挑战、3个先进LLM系列(含2代模型)和11个真实CVE上进行了系统实验,发现投毒效果具有系统性而非随机性:多数情况下,代理会采纳被投毒的信息并产生错误的行为。为解释这一现象,作者提出了验证边界(Verification Boundary, VB)的概念,这是一个三层次的经验分类,基于代理能够利用何种证据来反驳检索到的声明。此外,作者评估了验证提示(verification prompting)和多源检索(multi-source retrieval)两种防御措施,发现它们在存在强证据时有效,但在证据稀疏或零日条件下效果减弱。本文揭示了RAG安全代理面对知识污染时的脆弱性,并为设计更鲁棒的防御策略提供了理论基础。

💡 推荐理由: 揭示了AI安全代理在依赖外部知识时面临的新型投毒风险,对构建可信的自动化安全工具具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Aniket Wattamwar, Mrunal Kakirwar

本文提出了一种名为 π-RAG 的新型架构,旨在解决传统检索增强生成(RAG)系统中向量嵌入暴露于潜在反转攻击和非确定性检索失败的问题。核心创新在于利用数学常数 π 的数字作为超然熵源,构建一个不可变的间接层,将大型语言模型(LLM)与敏感数据存储解耦。具体而言,π-RAG 引入了一个语义量化层,将用户输入投影到预计算的典范意图质心(Canonical Intent Centroids)流形上,然后通过密码盐将质心映射到确定性偏移量,生成指向实际数据存储中标准化载荷的 π-key。这种设计从数学上保证了推理过程对数据的 oblivious(不可知),同时结合了确定性随机性、可审计性和差分隐私特性。实验表明,该架构在高合规性领域(如金融、医疗)具有高效性,能够在不牺牲语义理解的前提下实现隐私保护。论文的主要贡献包括:提出了一种新颖的 oblivious 检索方法,利用π的固有属性替代传统向量相似度搜索;设计了语义量化层以减少检索不确定性;并通过理论分析证明了其安全性。适合关注 LLM 隐私保护、数据安全和高合规性应用的研究人员与工程师阅读。

💡 推荐理由: 该架构为 LLM 隐私计算提供了新思路,利用数学常数π实现不可变间接层,有望在金融、医疗等敏感场景中安全地部署 RAG 系统。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Prashant Kumar Pathak, Tarun Kumar Sharma

该论文针对检索增强生成(RAG)系统中存在的向量中心(hubness)投毒风险提出了一种轻量级的准入时防御方法。在RAG中,少量文档可能成为大量查询的最近邻,这种“中心”现象使得攻击者可以通过注入一份恶意文档影响多个不相关请求的回答,构成数据投毒攻击。现有防御依赖于周期性的逆k近邻扫描,存在暴露窗口且需要重复扫描整个语料库,效率较低。作者研究了在文档插入阶段进行控制的方法:通过一组哨兵查询(sentinel queries)对每个待插入文档进行评分,隔离那些具有中心化特征的文档,从而在写入前阻断潜在投毒。在包含10万文档的两个语料库上,使用五种不同编码器,并在攻击者和防御者查询集不重叠的条件下,全局门控(global gate)在关键嵌入空间点达到召回率1.0(有效范围内≥0.92),对HotFlip攻击的召回率为0.91±0.07,对常规文档的误报率仅1%。按主题的局部门控(per-topic gate)则无可靠收益,这与各向异性耦合局部与全局可见性一致。阈值通过增量方式维护,插入成本与语料库规模无关,删除成本摊还。在HNSW索引上,准入控制使摄取延迟增加约3.1%,评分延迟在向量数达到百万级时仍保持平稳,近似索引导致的决策翻转仅占1.2%且不涉及攻击。论文还指出,对于自然或紧密领域的中心,溯源(provenance)可作为门控的补充。本研究适合RAG系统开发者、检索系统安全研究人员以及关注AI供应链安全的从业者阅读。

💡 推荐理由: 针对RAG系统投毒攻击提供了一种无需修改索引结构、在文档录入阶段即可生效的防御方案,填补了现有周期性防御的暴露窗口问题,实测高效且低误报,对工程落地有直接参考价值。

🎯 建议动作: 研究跟进,在内部RAG原型中复现并评估该方法的实际效果。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gulshan Saleem, Nisar Ahmed, Muhammad Imran Zaman, Ali Hassan

该论文针对检索增强生成(RAG)聊天机器人面临的提示注入攻击,特别是间接注入(通过污染知识库文档实现攻击),提出了一种三层防御框架。第一层(输入过滤层)使用基于规则的模式库和微调的语义异常分类器对用户输入进行筛查。第二层(上下文组装层)在执行上下文组装时,强制实施基于来源的指令层次结构,防止检索到的内容覆盖操作策略。第三层(输出审计层)在模型输出前,使用策略规则引擎和语义漂移检测器进行审核。此外,框架包含一个持续审计循环,聚合结构化日志并支持重新训练以适应新型攻击模式。该框架是模型无关的,作为中间件部署,无需修改底层LLM。在包含5,080个样本的测试集上,使用GPT-4o、Llama 3和Mistral 7B评估,攻击成功率(ASR)从71.4%降至11.3%,性能优于最佳单层基线27.3个百分点,优于已公开的护栏系统23.8个百分点,误报率仅4.8%,中位延迟开销61.2毫秒。消融实验证实三层提供互补保护,且组合效果超过各自贡献之和。

💡 推荐理由: 提示注入是LLM应用中最关键的漏洞(OWASP Top-1),而现有防御仅在单一阶段孤立防护。该论文提出了首个覆盖推理全管线的三层防御框架,有效降低了攻击成功率,为RAG系统的实际部署提供了可落地的安全方案。

🎯 建议动作: 建议内部评估该框架在自有RAG系统上的适用性,并参考其分层思想加固现有防御。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Chandranil Chakraborttii, Jackeline García Alvarado, Sitora Abdulofizova, Shivanshu Dwivedi

本文针对检索增强生成(RAG)流水线中广泛使用的分层可导航小世界(HNSW)向量数据库,揭示了软删除操作的严重安全隐患。当用户请求删除数据时,系统通常仅将记录标记为已删除,而实际嵌入在磁盘上保持不变,这违反了GDPR第17条和HIPAA等数据擦除与保留法规。作者在三个HNSW实现上验证,通过直接访问存储层的原始索引文件(绕过API)即可物理恢复已删除的向量。利用无需领域微调的Vec2Text反转模型,在多个真实数据集上展示了该漏洞:在维基百科在世人物数据集(BLP)上成功恢复25.5%的准确人名和46.4%的地理位置(ROUGE-L 0.185);在高度结构化的敏感数据(NIH Synthea数据集)上,患者年龄和性别的恢复率达到100%(ROUGE-L 0.290);在软删除的图像嵌入上,组织病理学切片的组织分类准确率为100%(p=1.02e-07),面部嵌入的top-1身份恢复率达99%(p<0.01)。作为防御,本文提出了Epoch密钥轮换机制:对向量进行加密,删除时丢弃密钥。该机制将观察到的PII恢复率降至0%,处理500个已删除向量仅需2.5毫秒(约0.005毫秒/条),并生成ECDSA签名的加密证明作为删除事件的可审计记录。本研究适合向量数据库开发者、RAG系统构建者、隐私合规工程师以及关注数据持久性安全的研究人员阅读。

💡 推荐理由: 该研究揭示了HNSW向量数据库中软删除操作被忽视的安全风险,直接威胁GDPR/HIPAA合规性,并提出了高效、可审计的防御方案(Epoch密钥轮换),对保障RAG系统中的敏感数据隐私具有重要实践价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.8)
👥 作者: Xinru Liu, Xianglong Zhang, Di Cai, Zhumin Chen, Pengfei Hu, Xin Xin

该论文针对检索增强生成(RAG)系统提出了一种新的模型中心攻击框架CAREATTACK,旨在通过编辑检索器模型而非操控语料库来注入恶意知识。RAG系统通常依赖外部知识库,现有攻击多通过构造恶意文本操纵语料库,但此类合成文本易被检测。CAREATTACK则直接攻击开源的密集检索模型,分为两个阶段:冲突感知检索器编辑和攻击保持锚点修复。第一阶段利用高效的闭式参数编辑技术,将恶意知识注入检索器,使其在检索时优先返回恶意文档,并通过基于图的冲突检测和参数编辑投影解决参数冲突,确保良性知识不受过度影响。第二阶段进行轻量级校准,消除对非目标提示的副作用,同时保持对目标提示的攻击有效性。论文在Qwen3-Embedding-0.6B和BGE-M3两个检索模型上,使用三个基准数据集进行实验,结果表明该方法能显著提升恶意文档在检索结果中的排名,并支持批量目标提示和文档的攻击。由于许多RAG系统基于开源检索模型构建,该工作揭示了实际攻击面,代码已公开。

💡 推荐理由: 该研究首次提出针对RAG系统检索器参数的模型中心攻击,不同于传统的语料库污染,具有更高的隐蔽性和可控性,迫使防御方关注检索模型本身的安全性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tarun Sharma

该论文聚焦于持久性 LLM 代理系统中的多会话记忆投毒(MSMP)攻击及防御。随着检索增强生成(RAG)代理广泛使用跨用户会话累积的持久记忆,攻击者可通过正常交互注入精心构造的记忆,当这些记忆被后续用户检索时,可操纵代理的响应,而无需修改模型权重或代码。现有防御如 RobustRAG 和 ReliabilityRAG 基于静态语料库,无法应对动态记忆;启发式过滤器则易被流畅的企业风格文本绕过。为此,作者提出了带签名记忆和平滑检索的 SMSR 框架,这是首个针对该场景提供认证鲁棒性边界的防御方案。SMSR 包含两个组件:组件1在写入记忆时添加 HMAC-SHA256 来源认证,阻止未签名的注入,实验中将未签名变体的攻击成功率从 93-100% 降至 0%;组件2在查询时应用随机记忆消融和基于裁决的多数投票,限制已认证对手的影响,针对单次注入的认证攻击,成功率被控制在 8.0%(95% CI [5.8, 10.9]),低于认证最坏情况。在端到端查询攻击中,SMSR 将成功率从 65.3% 降至 5.3%。理论方面,作者证明了无来源的检索时滤波器无法认证自适应注入,推导了组件2的超几何证书,并形式化了“一致少数效应”,即一致对抗答案在基于字符串的投票中可能作为数值少数获胜,而基于裁决的投票可消除该效应。实验涵盖 15 个企业场景(共 3150 次重复),干净查询的实用率在组件1下为 90%,组合后为 85%。该工作为持久记忆 LLM 系统的安全部署提供了重要理论基础和实践方案。

💡 推荐理由: 多会话记忆投毒是 LLM 代理面临的新兴攻击面,传统静态防御失效。SMSR 首次提供了可认证的鲁棒防御,对保护企业级 RAG 系统免遭持久记忆篡改具有里程碑意义。

🎯 建议动作: 研究跟进 SMSR 方法,评估集成到现有 RAG 持久记忆系统中的可行性,并考虑在写入记忆时添加来源认证。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.5
Conf: 50%
👥 作者: Pedro Pereira, Eva Maia, Isabel Praça, Adrien Bécue

检索增强生成(RAG)系统通过在推理时从外部知识源检索文档来增强大语言模型的生成能力,但这种对外部检索内容的依赖也引入了投毒攻击的脆弱性:攻击者可以通过注入对抗性文档来操纵检索过程和生成输出。本文通过一个涵盖432种配置的全因子实验研究,系统分析了RAG系统在投毒攻击下的鲁棒性。研究考察了数据集、检索器类型(BM25、密集检索、基于图的检索)、检索深度、数据库组成(仅投毒、投毒与干净混合、多个数据库)、分块策略(固定长度、按句子分割等)以及生成模型(如LLaMA、Mistral等)对检索层面指标(如检索命中率、召回率)和生成层面指标(如幻觉率、目标答案出现率)的影响。实验结果表明:检索器架构、数据集和检索深度是影响投毒暴露程度的最强因素;生成模型的选择和数据库组成对下游攻击成功率影响显著。具体来说,密集检索器和基于图的检索器相比BM25通常更鲁棒,而增大检索深度会显著增加检索到投毒段落的概率。研究还发现,在多个数据库中复制投毒内容会放大对抗性影响,而增加额外的干净来源则可以缓解这种影响。该工作揭示了RAG投毒脆弱性并非由单一组件导致,而是检索、生成和知识库配置之间相互作用的综合结果。

💡 推荐理由: 为RAG系统安全部署提供了首个系统性的因素分析,帮助安全从业者识别投毒攻击中最关键的配置变量(检索深度、检索器类型等),并指导防御策略的优先级。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hyunseok Paeng

本文揭示了基于检索增强生成(RAG)的大语言模型(LLM)推荐系统中一种可重复的安全训练失效模式,称为“注入悖论”。该现象表现为:嵌入在检索文档中的提示注入(prompt injection)非但没有帮助攻击者提升目标品牌推荐率,反而由于模型的安全训练特性,导致被注入的品牌推荐率显著下降,甚至低于无注入基线。在安全训练的Claude模型(如Claude Opus 4.6)上,即使语料库中该品牌的4个文档仅有1个包含注入,目标品牌的前2推荐率也从54%基线降为0(50次试验全部为零)。这种抑制效应不仅作用于被注入的文档本身,还会扩散至同一品牌的其他未修改文档。作者通过反事实实验和跨三个品牌的测试证实了这一方向性模式。值得注意的是,在GPT模型上观察到相反结果:相同注入反而增加了推荐率,表明不同模型系列对注入上下文的行为存在差异。这些发现提出了一种反向攻击场景的可能性:攻击者可能在竞争对手的文档中嵌入提示注入,利用模型的安全敏感性来抑制竞争对手的品牌。该研究对RAG系统的安全设计、提示注入防御策略以及LLM推荐系统的鲁棒性评估具有重要启示。

💡 推荐理由: 该研究揭示了一种新颖的注入攻击方向:攻击者可利用模型安全训练特性来压低竞争对手品牌推荐率,颠覆了传统上认为注入总是用于提升自身品牌的认知,为蓝队提供了新的对抗视角和防御切入点。

🎯 建议动作: 研究跟进:建议RAG系统开发者复现该现象,并评估自身模型在类似注入下的品牌推荐变化;考虑在检索阶段增加文档来源可信度验证或注入检测。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jianguo Zhu

检索增强生成(RAG)系统通常将用户查询、检索文档、元数据、系统标签和任务指令序列化为一个自然语言提示。本研究揭示了一种源权威边界失效模式:攻击者控制的检索文本可以冒充元数据、来源、权威或披露策略信号,这些信号对模型而言呈现为控制相关信息。作者将这种模式称为文档作者控制信号冒充(DACSI)。DACSI是间接提示注入的一个子类,采用非命令式、类元数据的载荷。其核心见解是:文档作者标签是数据,而非策略。命令式注入要求模型忽略、覆盖或违反策略;而DACSI则探索当RAG提示渲染将可信与不可信文本合并到同一自然语言通道时,不可信文档文本是否会被错误地归因为授权控制信号。作者在六种模型设置(DeepSeek V4 Pro、Qwen3.5-397B、DeepSeek V4 Flash、GPT-5.5、Gemini 3.1 Pro Low、GLM-4.7)下,结合不同的提示压力水平、注入基线、信号分类、RAG中介管道、系统控制探测、源权威归属探测以及合成金丝雀格式进行了评估。实验按模型制度解释证据:DeepSeek V4 Pro和Qwen3.5-397B提供了最清晰的正向提升(即易受攻击),DeepSeek V4 Flash是高风险设置,GPT-5.5和Gemini 3.1 Pro Low是强边界探测但仍存在选择性残留风险,GLM-4.7是饱和泄漏边界案例。结果表明,DACSI值得单独评估,因为它利用无命令的元数据/来源/策略表面,沿RAG特定源权威路径进行攻击,并且对源/通道分离有响应。源权威归属探测提供了行为归因证据,而非内部机制证明。该研究适合RAG系统开发者和安全工程师关注,强调了在提示渲染中区分可信与不可信来源的重要性。

💡 推荐理由: DACSI攻击成本低、易实施,利用了RAG系统将用户查询与检索文档混合到单一提示的设计缺陷,可绕过安全边界导致信息泄露或非授权操作。随着RAG在对话系统和企业搜索中的广泛应用,该攻击具有普遍威胁。

🎯 建议动作: 实验验证并评估自身RAG系统对该攻击的鲁棒性,考虑实施源/通道分离防御措施

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinghuai Zhang, Pengyue Yu, Zhexiao Lin, Kunlin Cai, Fnu Suya, Yuan Tian

本文提出 ImageAuditor,一种针对基于图像检索增强生成(IRAG)系统的成员推理攻击(MIA)方法。IRAG 系统利用外部数据库中的参考图像来增强冻结的生成器,支持文本到图像(T2I)和问答(Q&A)任务。由于这些数据库通常不透明且内容来自网络爬取,版权所有者需要审计特定图像是否出现在数据库中。现有的针对单模态文本 RAG 的 MIA 方法无法直接迁移到 IRAG,主要面临两个挑战:一是跨模态检索,无法像文本 RAG 那样通过将目标内容注入查询来强制检索目标图像;二是判别信号提取,IRAG 中的 T2I 生成器输出图像而非文本答案,难以通过问题回答提取成员信号。为克服这些挑战,ImageAuditor 将每个攻击查询分解为检索段和提取段,并分别进行优化。在检索段,提出奖励引导的策略优化(RGPO)方法,通过从奖励排序的候选中更新随机策略来导航跨模态嵌入空间,并具有有限样本最优性保证以平衡探索与利用。在提取段,分析 MIA 评分的分布以协同设计提示策略和评分规则,并为 T2I 和 Q&A 任务推导出特定实例化。通过 K-means 聚类聚合多个查询的信号以做出可靠的成员判断。实验表明,ImageAuditor 在多种 IRAG 系统上仅需每个被审计图像 4 个查询即可达到超过 80% 的 AUROC,并且在各种设置下均表现鲁棒。

💡 推荐理由: 首次提出针对图像多模态 RAG 系统的成员推断攻击,为版权审计和数据泄露风险提供了新的评估工具。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuyang Gong, Miaokun Chen, Jiawei Liu, Zhuo Chen, Guoxiu He, Wei Lu, XiaoFeng Wang, Xiaozhong Liu

本文提出了一种针对检索增强生成(RAG)系统的新型攻击范式——话语级意见操纵。RAG系统通过结合外部语料库来增强大语言模型的回答,但这也引入了检索内容投毒的安全风险。现有攻击大多聚焦于单个查询或狭窄主题的局部查询集,实际影响有限且易于察觉。作者定义了话语级意见操纵威胁模型:攻击者通过构造一个语义查询网络,在多个主题相关的查询上协调操纵检索结果,诱导系统在整体多主题查询空间中产生连续的、目标导向的意见偏移。该威胁模型假设黑盒场景,攻击者只能通过投毒外部文档(即检索语料库)来影响系统输出,且受限于投毒预算。为此,作者提出DiscourseFlip,一种智能体驱动的图引导攻击方法。其核心思想是:将查询网络建模为图,利用图结构分析各节点(查询)的意见传播影响,动态分配有限的投毒预算到关键节点(文档),以最大化全局意见偏离。实验使用多个主题的RAG系统(如基于Llama2-7B的RAG)进行验证,结果表明DiscourseFlip能持续、高效地诱导目标意见偏移,在覆盖率和有效性上显著优于现有的基线攻击(如基于单一查询的投毒或随机投毒)。用户研究表明,被操纵后的回答不易被用户察觉。此外,系统分析发现当前主流的防御策略(如输入过滤、对抗训练)无法有效抵御这种话语级操纵,凸显了开发鲁棒自适应防御的紧迫性。本文主要贡献在于:(1)定义了RAG系统的新威胁模型;(2)提出了有效的图引导攻击算法;(3)揭示了现有防御的不足。适合RAG安全研究者、LLM应用开发者和安全分析师阅读。

💡 推荐理由: 揭示了RAG系统在话语级操纵下的新安全漏洞,现有防御几乎无效,直接影响大模型输出可靠性和用户信任。

🎯 建议动作: 研究跟进,评估内部RAG系统对分布式、多话题操纵的脆弱性,探索图结构检测与鲁棒检索策略。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jiachen Qian

检索增强生成(RAG)通过引入外部知识库来缓解大语言模型的幻觉问题,但同时也引入了语料库完整性的新攻击面。本文提出 SilentRetrieval,一种两阶段数据投毒攻击,能够在不破坏文档流畅性的前提下劫持 RAG 系统。第一阶段使用协调束搜索(Coordinated Beam Search),这是一种结合流畅性-相似性目标的多 token 联合优化方法,使被污染的宿主文档在保持低困惑度的同时仍然可检索。第二阶段使用上下文自适应触发器生成(Context-Adaptive Trigger Generation),利用冻结的 LLM 驱动轻量级触发器融合步骤,将操纵触发器嵌入文档内容。在单毒化文档每查询的评估设置下,使用合成目标答案,SilentRetrieval 在 Natural Questions 和 MS MARCO 数据集上分别实现了 84.6%/81.3% 的 HR@10 和 57.5%/54.8% 的 ASR-LLM,同时保持接近良性文档的困惑度。跨模型评估显示,在固定触发器生成器下对四种目标 LLM 仍有非平凡效果;针对包括 ColBERT 和商业嵌入模型在内的未见检索器的迁移测试,在相同注入语料协议下平均 HR@10 为 64.7%。在采样维基百科规模评估中,以 0.016% 的投毒比例仍保持 74.2% 的 HR@10。结合检索侧和生成侧的防御虽然显著降低了攻击成功率,但引入了延迟权衡。人工评估显示,与不流畅的基线相比,标记率更低,但在当前样本量下仍比良性内容数值上更可疑。该研究揭示了 RAG 系统在面对精心构造的对抗性文档时的脆弱性,并提示需要更鲁棒的防御机制。

💡 推荐理由: RAG 系统被广泛用于减少 LLM 幻觉,但本文展示了一种隐蔽的数据投毒攻击,能够以极低投毒比例劫持检索结果,影响输出安全性。对于构建 RAG 应用的安全团队,该研究揭示了现有防御的不足,需关注语料库完整性保护。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

该论文重新评估了生成式引擎优化(GEO)中的提示注入攻击在真实检索增强生成(RAG)系统中的有效性。先前的研究表明,通过提示注入可以将目标产品推至LLM推荐列表的顶部,成功率约80%,但假设被攻击的文档始终直接输入生成器,忽略了检索器和重排序器。本研究在更现实的三个阶段管道(检索器→LLM重排序器→LLM生成器)中评估了七种GEO攻击。发现之前的协议严重高估了攻击效果:基于梯度和指令覆盖的攻击在到达生成器之前基本失效,只有基于LLM的提示注入在端到端中仍然有效。进一步分析表明,当前的GEO攻击很容易被检测:一个在小型攻击数据集上微调的轻量级提示注入防护器即可检测所有攻击。论文提供了代码和数据。

💡 推荐理由: 揭示了当前GEO攻击在真实RAG管道中的有效性被高估,并指出了可被轻量级防护器检测的弱点,对RAG系统的安全评估与防护设计具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Syed Huma Shah

本文针对检索增强生成(RAG)系统中的缓存安全问题展开研究。现代RAG部署广泛使用缓存来降低token成本和时间至首token延迟(TTFT),其中前缀级KV复用已是标准做法,但输出级的语义答案缓存仍然脆弱:相似提示可能映射到不同正确答案,检索证据随语料更新而漂移,且存在对抗性碰撞攻击可劫持缓存响应。作者指出缓存答案复用的关键问题不在于如何更快复用,而在于何时复用是安全的。为此,他们提出GroundedCache——一种基于证据验证的缓存路由器,仅当四个廉价门控条件同时满足时才允许复用缓存答案:查询相似性、检索证据重叠、源版本有效性以及新检索证据对缓存答案的词汇(或基于评判器)支持。研究构建了一个六模态工作负载来压力测试缓存安全性而非仅关注命中率,并引入面向运营者的指标——不安全服务率(USR),即接收到错误缓存答案的查询比例。在2个数据集和12,000个真实LLM生成(使用vLLM和自动前缀缓存的Qwen2.5-7B-Instruct)上的实验表明,GroundedCache在HotpotQA的每个模态下将USR降至0.0%(而朴素缓存为15-35%),在mtRAG文档漂移下降至1.5%(对比51.5%),在对抗性模态下实现34倍减少,在其他mtRAG模态下减少3-10倍,同时端到端中位延迟保持在无缓存RAG基线的1.04-1.07倍。消融实验显示,词汇支持门控是两个数据集上的主要安全机制,其他门控以接近零成本提供深度防御。本文适用于RAG系统开发者、缓存设计者和安全研究者。

💡 推荐理由: 揭示了RAG中缓存答案复用的安全漏洞,提出一种轻量级验证机制,可显著降低不安全缓存服务率(USR),对保障RAG系统输出正确性至关重要。

🎯 建议动作: 研究跟进:评估将GroundedCache集成到现有RAG缓存栈的可行性。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhe Yu, Wenpeng Xing, Gaolei Li, Shuguang Xiong, Hongzhi Wang, Xuyang Teng, Meng Han

该论文针对检索增强生成(RAG)系统面临的知识投毒攻击,提出了一种基于信息流控制的防御框架CORDON-MAS。研究发现,现有防御方法(如污染检测)存在监控-控制差距:模型能够检测到检索结果中的矛盾证据,但仍会基于被污染的文档生成有害输出。作者提出科登原则(Cordon Principle):任何负责最终合成的智能体不得直接访问未受信任的自然语言证据。基于此原则,设计了CORDON-MAS框架,通过将证据提取、跨源审计和答案合成分离为具有非对称内存权限的独立智能体,从架构上强制实施信息流控制。在五个BEIR数据集上的实验表明,相比无防御的RAG系统,CORDON-MAS将攻击成功率降低了92.4%。该工作将RAG投毒问题从检测问题重新定义为信息流控制问题,为构建可信RAG系统提供了新思路。

💡 推荐理由: 首次揭示了RAG防御中监控-控制差距的存在,并提出将投毒防御从检测转向信息流控制的新范式,对保障基于RAG的高风险应用安全具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mohammed N. Swileh, Shengli Zhang, Kai Lei

软件定义网络(SDN)因其集中控制架构而面临分布式拒绝服务(DDoS)攻击的严重威胁,特别是地毯式轰炸(Carpet-Bombing)DDoS攻击,这种攻击将恶意流量分散到多个目标以逃避传统检测机制。本文提出了一种基于检索增强生成(RAG)的框架,用于在SDN环境中实时检测和缓解此类攻击。该框架结合了接口级流量特征表示、语义嵌入生成、基于FAISS的相似性检索以及大语言模型(LLM)驱动的上下文推理,无需传统的监督模型训练或重训练即可对流量行为进行分类。为评估框架有效性,作者在多种地毯式轰炸DDoS攻击场景下进行了大量实验,涵盖不同攻击强度。同时,研究了两种流量表示策略:基于JSON的结构化表示和基于自然语言的表示(NLR),并使用了多个最先进的LLM。实验结果表明,该框架实现了高准确率和稳定的攻击检测性能,其中使用Gemma-4-31B-IT模型的配置取得了最强的整体检测效果。实时实验验证了该框架能够快速检测并缓解地毯式轰炸DDoS攻击,同时保持SDN网络稳定运行。研究成果凸显了将RAG机制与LLM相结合用于智能自适应SDN安全分析的有效性。

💡 推荐理由: 地毯式轰炸DDoS攻击难以被传统检测机制发现,而该研究首次将RAG和LLM结合用于SDN环境下的实时检测与缓解,为智能网络防御提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nguyen Linh Bao Nguyen, Wanlun Ma, Viet Vo, Alsharif Abuadbba, Minghong Fang, Jun Zhang, Yang Xiang

本文研究检索增强生成(RAG)系统中的成员推断攻击(MIA)问题。RAG通过将外部知识库引入LLM响应,有效减少幻觉,但同时也带来了新的隐私风险:攻击者可能通过模型输出推断检索语料库中是否存在特定文档,从而泄露敏感信息。现有MIA方法要么依赖于易被检测的模板化查询,要么需要大量非模板化但成本高昂的重复查询,实用性受限。本文提出MEntA(Membership Entailment Attack),一种查询高效且无需影子模型的成员推断攻击方法。MEntA利用自然语言蕴涵(entailment)最大化每次查询的信息增益:攻击者以低成本、广泛的信息寻求性问题进行提问,并度量模型回答与候选文档之间的蕴涵关系,从而判断文档是否被检索。该方法无需训练影子模型,也不需要大量查询预算。在NFCorpus、SCIDOCS和TREC-COVID三个数据集上的实验显示,MEntA仅需5次查询即可达到最高0.991的AUC,在同等条件下比现有方法提升0.20-0.50 AUC。同时,MEntA能够规避当前最先进的RAG防御机制,而现有检测器要么漏检MEntA,要么对良性查询误报率高。在成本方面,与同设置下的最新攻击相比,MEntA将总攻击成本降低至1/65。本文研究揭示了RAG系统中低成本隐私泄露的现实可行性,强调了对隐私感知检索和防御机制的迫切需求。适合安全研究人员、LLM部署者以及隐私工程师阅读。

💡 推荐理由: 本文揭示RAG系统存在低成本的成员推断攻击风险,仅需5个自然语言问题即可高精度推断语料库中是否存在特定文档,可能泄露企业机密或用户隐私数据。该攻击无需影子模型、查询量小且能逃避现有防御,对实际部署的RAG系统构成严重威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Chengcai Gao, Zhihong Sun, Xiaochuan Shi, Qiufeng Wang, Chao Liang

本文针对检索增强生成(RAG)系统面临的安全威胁,提出了一种名为BiRD(双向排序防御机制)的新型防御方法。研究首先识别了现有防御手段(如基于语义分析或投票机制)的核心局限性:它们仅关注语义内容相关性,而忽略了由排序结构定义的检索上下文。通过对被毒化文档与良性文档的双向排序行为分析,作者发现了一个关键区分模式:被毒化文档的反向排序与查询的正向排序之间表现出显著更强的对齐性。利用这一发现,BiRD构建了一个双信号框架,其中正向排序用于评估语义内容相关性,反向排序用于量化排序上下文的一致性,从而同时实现了高效性和鲁棒性。在3个数据集、3种检索器和3种大语言模型上,针对2种攻击场景的广泛评估验证了BiRD的有效性。特别地,BiRD将PoisonedRAG攻击的成功率降低高达54%,同时将任务准确率提升高达56%,且平均额外延迟低于1秒。该工作为RAG系统的对抗性防御提供了新思路,适合研究对抗机器学习、RAG安全以及信息检索的学者和工程师阅读。

💡 推荐理由: RAG系统正面临日益严重的对抗性攻击,现有防御存在计算成本高或鲁棒性不足的问题。BiRD利用双向排序模式差异,以低延迟实现高防御效果,为实际部署提供了可行方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.5
Conf: 50%
👥 作者: Florian A. D. Burnat, Brittany I. Davidson

本文聚焦于多租户检索增强生成(RAG)服务中的隐私审计问题。现有RAG系统通常声称每个账户满足差分隐私(DP),即每个账户的查询对索引满足(ε_acc, δ_acc)-DP。然而,作者发现同租户下多个账户合谋(即同一租户的多个账户协调攻击其租户的索引)会导致隐私边界失效:对于高斯噪声检索,已知DP组合理论表明,合谋者的联合泄漏以Θ(√k·ε_acc)的速率无条件恶化。跨租户和外部合谋只有在显式访问控制失败(M4)时才会达到相同速率,否则这些场景的设计泄漏为零,属于架构审计而非DP审计。作者展示了一种实现该速率的攻击,并推导出针对RAG的成员推理攻击(MIA)预测,并通过实验验证。为了能够审计这种每个账户与联合隐私之间的差距,作者设计了第一个审计协议,该协议运行在未修改的RAG部署上,针对检索-分数通道(即每个账户DP保证实际覆盖的噪声-选择步骤)输出定量的(PASS, ε_audit)判定,而无需索引披露、流水线重新设计或模型权重暴露。生成通道隐私(即基于所选文档的LLM输出)被视为独立的审计谓词,应与此协议组合,但本文明确将其排除在外。该协议组合了通用密码学原语(Merkle账本、ZK函数应用证明、高斯噪声证明)与六个RAG特定原语(嵌入承诺、索引内容向量承诺、每个账户查询账本、噪声-选择证明、跨租户包含证明、合谋规模估计器),并支持封闭形式的审计边界和Rényi-DP矩会计追踪。

💡 推荐理由: 该研究揭示了多租户RAG系统中每个账户差分隐私声明的漏洞,即同租户多账户合谋可显著放大隐私泄漏,并提供了首个可部署的审计协议,有助于验证实际RAG服务的隐私承诺,对依赖RAG的云服务提供商和审计人员具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Osama Zafar, Alexander Nemecek, Yiqian Zhang, Wenbiao Li, Debargha Ganguly, Vikash Singh, Vipin Chaudhary, Erman Ayday

该论文针对检索增强生成(RAG)系统中的隐私泄露问题,指出传统PII过滤器容易忽略上下文数据泄露,例如通过非受管属性聚类可识别个人身份。作者提出了一种隐私政策执行(PPE)框架,采用双单类密度估计器,融合文本嵌入,并引入校准的拒绝区域以处理分布外输入。通过轴分层、多LLM合成数据流水线,在医学、金融和法律领域生成数据,发现传统高斯混合基线在边界安全压力测试中失败,因为它们关注语言风格而非内容。提出的T3+OCSVM检测器在安全和边界安全数据上训练,边界AUROC达到0.93以上,同时将误报率降低44-55个百分点,并保持毫秒级延迟。与有监督MLP分类器或14B参数LLM法官相比,该框架具有优越的操作适用性,前者拒绝率高,后者存在延迟和校准问题。该方法为任何合成数据训练的分类器提供了稳健的压力测试标准。

💡 推荐理由: RAG系统在敏感领域广泛应用,现有隐私保护手段无法处理上下文推断攻击,本工作首次提出针对性的轻量级隐私政策执行框架,具有高精度和低延迟,实用价值高。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi

本文研究了多模态检索增强生成(RAG)系统在医疗应用中的安全性,重点关注知识投毒攻击。现有攻击大多假设攻击者掌握用户查询的先验知识,这在真实场景中难以实现。为此,作者提出了M³Att攻击框架,仅需了解数据库的有限分布知识。核心思路是:向文本数据中注入隐蔽的虚假信息,同时利用配对的视觉数据作为与查询无关的触发器,以操纵检索概率。攻击者通过向视觉输入施加不可察觉的扰动来改变检索结果,并利用医疗诊断的固有模糊性设计隐蔽错误信息注入策略,使模型生成临床看似合理但错误的诊断,同时规避大语言模型(LLM)的自我纠正。在五个LLM和数据集上的实验表明,M³Att能持续产生合理但错误的输出。该研究揭示了医疗多模态RAG系统的脆弱性,为防御机制设计提供了参考。

💡 推荐理由: 医疗RAG系统依赖外部知识库,若被投毒可能导致错误诊断,威胁患者安全。本攻击不依赖用户查询先验,更贴近真实威胁,值得安全从业者关注。

🎯 建议动作: 研究跟进,评估内部医疗RAG系统对此类攻击的脆弱性,并探索输入过滤、异常检测等防御机制。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kennedy Edemacu, Mohammad Mahdi Shokri, Vinay M. Shashidhar, Jong Wook Kim

本文提出了一种名为PAS(Privacy Anchor Substitution)的结构化机制,用于在空间检索增强生成(RAG)系统中实现用户位置隐私保护。与传统的差分隐私方法直接扰动用户位置不同,PAS采用相对锚点编码来表示位置,该编码由锚点、方向箱和距离箱组成,能够无缝集成到现代RAG流程中。研究团队在一个合成城市数据集上评估了PAS,实验结果表明,PAS能够实现约370-400米的敌方位置误差,提供较强的粗粒度隐私保证,同时保留了基线检索性能的一半以上。尽管检索性能略有下降,但下游生成质量在PAS下保持相对稳健,说明大型语言模型能够补偿不完美的空间检索。进一步的经验分析显示,PAS的隐私-效用关系相对于隐私参数呈非单调特性,作者将其归因于锚点离散化带来的几何偏差,这使其与连续噪声机制(如地理不可区分性)不同。研究结论表明,结构化空间表示为RAG系统中基于位置的推理提供了一种实用的隐私保护方法。该工作对于关注LLM应用中隐私保护的研究人员和工程师具有参考价值。

💡 推荐理由: 该研究为空间RAG系统中的用户位置隐私保护提供了新的结构化方法,避免了传统差分隐私对检索效用的过度破坏,对构建隐私保护的地理位置感知AI服务具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jayson Ng, Amin Milani Fard

该论文针对大型语言模型(LLM)在恶意软件分析中的应用进行了实证研究,重点评估检索增强生成(RAG)技术对解释质量的影响。研究背景是:安全分析师常借助LLM来自动总结和解释恶意软件行为,而RAG被认为可以通过注入外部安全知识来提升解释质量。作者以VirusTotal报告作为结构化输入,在多个LLM上对比了有无RAG时的解释效果。实验发现,RAG在大多数情况下反而降低了解释质量,具体表现为:引入分散注意力的弱相关上下文、增加叙述噪声或生成泛泛的写实性描述。这表明,当结构化安全证据已经足够时,RAG会产生反效果。作者因此提出,恶意软件解释本质上是信号提取任务,而非知识检索问题,并基于此给出了安全开发工作流的设计建议。该研究挑战了RAG在安全关键型管道中的普遍适用性,为未来设计更可靠的LLM辅助分析工具提供了重要参考。

💡 推荐理由: 揭示RAG在恶意软件解释中可能降低质量,挑战了常见假设,提醒安全从业者谨慎应用RAG于分析管道。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)