#poisoning

共收录 17 条相关安全情报。

← 返回所有主题
👥 作者: Harsh Chaudhari, John Abascal, Alina Oprea, Matthew Jagielski, Florian Tramèr, Jonathan R. Ullman

本文研究针对机器学习模型训练数据隐私的“属性推断攻击”(Property Inference Attack)问题。此类攻击旨在从已训练模型中提取训练数据集的全局统计属性(如某类样本占比、数据分布特征),对共享数据参与训练的机构或个人构成隐私风险。现有基于影子模型的属性推断攻击虽有效,但攻击者需训练大量影子模型,计算开销巨大。本文提出一种新的攻击框架 SNAP,其核心是在训练数据中投毒(poisoning)一小部分样本,并利用模型在投毒影响下的置信度输出进行统计分析。作者首先从理论上分析了在数据投毒条件下模型置信度的变化规律,据此设计了高效的统计检验方法,使攻击者无需训练任何影子模型即可推断目标训练数据的属性。实验基于四个数据集(包括 Census 等)和多种不同比例的属性展开,结果显示:在 Census 数据集上,SNAP 相比当前最优的基于投毒的属性推断攻击(Mahloujifar 等人提出的方法),攻击成功率提升了 34%,且运行速度快了 56.5 倍。此外,SNAP 还支持两种扩展能力:一是判断训练过程中是否包含某个特定属性(存在性检测);二是估计目标属性在训练数据中所占的精确比例。论文通过多个场景验证了 SNAP 的通用性和有效性,表明该攻击能以极低的计算成本实现高成功率的隐私提取。本文的主要贡献在于提出了一种兼具理论依据和实际效率的新型属性推断攻击方法,降低了此类攻击的门槛,并拓展了推断能力。适合关注机器学习隐私、对抗性攻击与防御、数据安全的研究者和安全从业者阅读。

💡 推荐理由: 该攻击显著降低了属性推断攻击的计算门槛,使普通攻击者也能高效提取模型训练数据的全局属性,对数据共享和联邦学习场景的隐私构成新威胁。安全团队需了解此类投毒+推断的攻击模式,以便评估自身模型暴露风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Prashant Kumar Pathak, Tarun Kumar Sharma

本文研究检索增强生成(RAG)系统中的投毒攻击与防御局限。RAG 通过从向量库检索段落作为上下文来回答问题,因此任何能够添加文档的人都有可能操纵答案。一种近期的防御方案是在文档摄入时进行过滤,拒绝任何行为类似“枢纽”的文档。作者证明这种过滤以及所有摄入时防御都会被一种协调攻击者击败:攻击者注入少量单独看起来无异常的文档,这些文档共同围绕一个目标查询并占据其 top-k 结果。在 BGE-large / BEIR 数据集上,仅需 10 个文档即可在 10/10 的目标上成功,在实时 HNSW 索引上为 9.9/10。该攻击并非纯理论,而是实现为普通流畅文本,并通过 BGE-large + HNSW + Qwen2.5-7B 流水线进行端到端运行,使生成器在 88% 的目标中输出攻击者植入的声明,而无不投毒时为 0%。此外,任何摄入时防御都无法阻止该攻击:在摄入时,攻击锥在几何上与合法利基上传相同,作者直接测量发现,即使给定所有特征和数千个示例,最强的训练分类器区分两者也不优于随机猜测(在 1% 假阳性率下仅捕获 4.2% 的攻击)。作者证明这一局限适用于所有摄入时统计量(仅从文档和参考查询做出任何决策),并在两个语料库和五个编码器上重复出现,且效果恶化。唯一能区分攻击与合法利基摄入的信号——查询需求——在检索前不可见,这也提供了逃逸途径:观察需求的检索时检测器在相同的 1% 假阳性率下能够捕获 100% 的攻击。结论是:摄入门禁对查询空间的覆盖并不等同于对协调投毒的遏制;稳健防御必须超越前门,转向需求侧。本文适合安全研究人员、RAG 系统开发者以及关注 AI 供应链安全的从业者阅读。

💡 推荐理由: 该研究揭示了 RAG 系统摄入时安全机制的认知盲区,证明基于文档特征的过滤无法防御协调投毒,对依赖向量检索的 AI 应用安全设计有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zijian Wang, Yubo Zhu, Muzhi Dong, Yanjun Lou, Yisheng Li, ZiLiang Zhang, Wei Tong, Yuan Zhang, Jingyu Hua, Sheng Zhong

本文研究检索增强生成(RAG)系统中后检索冲突消解机制对知识投毒的鲁棒性。现有黑盒投毒攻击通常以正面反驳的方式直接断言目标答案,与冲突消解器视为'已定事实'的参考信号形成明显矛盾,因此容易被检测。作者提出一种名为 PURPOSE 的严格黑盒投毒攻击方法,将注入内容重新定义为一种'最小化冲突的更新',而非对抗性反驳。PURPOSE 首先从查询中提取与消解器可能参考事实相关的命题,然后以这些事实为锚点构造一个'代理事实'作为事件支撑,使注入内容与消解器可能验证的信息保持一致,同时引导生成器输出目标答案。实验基于三个问答基准、五个生成器和三种冲突消解方法,PURPOSE 在 45 种设置中的 35 种取得最高攻击成功率(ASR),相比最强的先前攻击平均 ASR 提升 9.7 个百分点。结果表明,非矛盾式注入是增强 RAG 投毒攻击的一种实用模式,并揭示现有冲突消解机制在面对一致性投毒时的脆弱性。适合关注大模型安全、RAG 系统可信性和对抗性机器学习的蓝队研究人员与安全工程师阅读。

💡 推荐理由: 揭示 RAG 中看似合理的冲突消解机制仍可被巧妙投毒利用,攻击者无需白盒信息即可实现高成功率,威胁企业级 RAG 应用的输出可信性。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mingyue Yang, David Lie, Nicolas Papernot

这篇论文针对恶意软件分类系统中的概念漂移问题展开研究。随着恶意软件不断演化,数据分布会发生漂移,导致分类器性能下降。为此,研究者开发了基于机器学习的数据漂移检测工具来监控输入数据分布的变化。然而,此类检测器与恶意软件分类器在设计目的和技术上存在差异,因此针对分类器的对抗攻击(如规避攻击和投毒攻击)如何影响检测器,以及两者组合使用时的安全性尚不明确。本文通过实证分析,系统研究了规避与投毒攻击对数据漂移检测器以及整个恶意软件检测流程的影响。实验发现,数据漂移检测器的独特特性(如对数据分布变化的敏感性)使得原本针对分类器的攻击在联合场景下表现出不同的效果,可能引发检测器的误报或漏报,进而影响整个系统的可靠性。研究揭示了这一关键交互作用,为理解对抗攻击在多层检测架构中的传播提供了新视角,并为构建更稳健的恶意软件防御系统提供了理论基础和实验依据。

💡 推荐理由: 现代恶意软件检测系统中,分类器与数据漂移检测器常协同工作;本文揭示了对抗攻击会以意外方式影响漂移检测,安全团队需关注联合系统的鲁棒性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Abay Zhurekbay, Tao Liu, Fan Li

本文研究检索增强生成(RAG)系统面临的数据投毒威胁。作者指出,已有单文档投毒攻击通常避免在恶意文档中显式提及正确回答,而是采用间接方式误导。DenialRAG 则采用相反策略:在投毒文档中直接写明正确回答,然后明确否定该回答,并附加一个看似合理的错误解释,从而在检索结果被生成器阅读时,将矛盾直接嵌入上下文。通过这种方式,攻击者可以操纵模型输出错误答案。为了验证有效性,作者在三个开放域问答数据集上,将 DenialRAG 与四种已发表的单文档投毒攻击对比,测试了来自四个厂商的八个目标大语言模型,并评估五种推理时防御机制。实验显示,攻击成功率高度依赖目标模型:DenialRAG 在所有 Mistral-7B 数据集上取得最高成功率,部分其他模型上也表现良好,但某些模型上其他攻击更优。防御措施能够降低成功率,但无法完全消除,且不同防御对不同模型效果不一。组件级分析表明,嵌入式拒绝(denial)是影响攻击效果的最关键组件;跨模型分析显示不同投毒机制在不同模型族上失效速度不同。作者总结,RAG 投毒风险不能由单一攻击家族或单一目标模型来刻画,需要多维度评估。

💡 推荐理由: RAG 系统在企业 AI 应用中日益普及,语料库投毒可导致模型输出被定向篡改,威胁信息可信度。DenialRAG 揭示了即使显式提及正确答案也能成功误导模型的攻击方式,提示防御方需综合考虑文档内部冲突与模型自身鲁棒性,而非仅依赖简单过滤。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 9.5
Conf: 50%
👥 作者: Shaofeng Li 0001, Hui Liu, Tian Dong, Benjamin Zi Hao Zhao, Minhui Xue 0001, Haojin Zhu, Jialiang Lu

本文展示了自然语言处理(NLP)系统容易受到后门攻击,攻击者可以在语言模型中植入隐藏特征(后门),仅当特定触发条件(如特定输入文本)出现时才会被激活,导致模型产生意外行为。作者提出了两种创建隐蔽且自然触发器的文本后门攻击方法,称之为“隐藏后门”。第一种方法基于同形字符替换(homograph replacement),通过视觉上相似的字符替换(例如使用Unicode同形异码字符)来嵌入触发器,这种替换对人类视觉检查具有欺骗性。第二种方法利用语言模型生成的文本与真实自然文本之间的细微差异,生成语法正确、流畅度高的触发句子,使之难以被察觉。作者在三个代表性的安全关键型NLP下游任务上验证了攻击效果:毒性评论检测、神经机器翻译(NMT)和问答(QA)。实验结果显示,在毒性评论检测任务中,仅需注入3%的含触发数据即可达到至少97%的攻击成功率(ASR);在NMT任务中,注入数据少于0.5%即可达到95.1%的ASR;在QA任务中,仅用27个投毒样本(原训练集包含92024个样本,即0.029%)即可实现91.12%的ASR。攻击在保持模型对正常用户功能的同时,使触发器对人类管理员不可见。该研究揭示了现代以人为中心的NLP系统在面对精心设计的后门攻击时的脆弱性。

💡 推荐理由: 该研究揭示了NLP模型极易被植入隐蔽后门,且触发器可绕过人类审查,对部署了毒性检测、机器翻译、问答等NLP系统的安全防御团队构成严重威胁。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Roei Schuster, Congzheng Song, Eran Tromer, Vitaly Shmatikov

本文研究了神经代码自动完成器(基于Pythia和GPT-2的新型自动完成系统)面临的数据投毒和模型投毒攻击。代码自动完成是现代IDE的核心功能,最新一代自动完成器使用在公开开源代码上训练的神经语言模型,根据当前上下文提供智能建议。研究发现,攻击者可以通过向训练语料中添加少数精心构造的恶意文件(数据投毒)或直接在恶意文件上微调自动完成器(模型投毒),使其在特定上下文中推荐不安全代码,例如AES加密的不安全ECB模式、SSL/TLS协议的SSLv3版本、或密码加密的低迭代次数。进一步地,攻击可以具有针对性:定向投毒后,自动完成器对来自特定仓库或特定开发者的文件更可能推荐不安全的补全。实验量化了定向和非定向数据投毒与模型投毒攻击的有效性,并测试了现有防御(如基于困惑度的过滤、差分隐私训练),发现它们基本无效。论文揭示了神经代码自动完成系统的新型供应链安全风险,并强调了开发鲁棒性防御的紧迫性。

💡 推荐理由: 如果攻击成功,开发者使用的IDE可能被恶意植入不安全代码建议,导致软件供应链中毒。这对依赖代码自动完成提高生产力的开发团队构成直接威胁,且现有防御手段不足。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yan-Lun Chen, Pin-Yu Chen, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee

该论文针对检索增强生成(RAG)系统面临的语料库投毒攻击问题,提出了一种轻量级检测框架TRACE。RAG系统通过检索外部文档来增强大语言模型的生成能力,但攻击者可向检索库中注入恶意文档,诱导模型输出特定目标答案。现有检测方法通常依赖额外的分类器或基于LLM的验证,计算开销较大。TRACE通过令牌影响归因(token influence attribution)来识别投毒攻击:首先在所有检索到的文档中寻找具有高影响力的重复关键词(recurrent high-influence keywords),这些关键词可能是攻击者植入的触发词;然后进行二次验证,确认这些关键词对模型预测的实质性影响。该方法无需训练辅助模型或调用外部LLM,仅需分析模型内部的梯度或注意力信号。实验在三个问答基准数据集(如Natural Questions、TriviaQA等)和六个主流LLM(包括GPT系列、LLaMA等)上进行,结果表明TRACE能够有效检测投毒攻击,且计算开销远低于对比方法。此外,TRACE还能揭示攻击者指定的目标答案,为后续防御提供线索。该工作为RAG系统的安全性提供了一种实用且高效的检测方案。

💡 推荐理由: RAG系统在工业界广泛部署,语料库投毒攻击威胁其可信输出。TRACE提供了一种轻量级、无需额外模型的检测方法,可集成到现有流水线中,提升安全水位。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Till Gehlhar, Felix Marx, Thomas Schneider 0003, Ajith Suresh, Tobias Wehrle, Hossein Yalame

联邦学习(FL)因其在本地训练模型并保护隐私的能力而在各行业广泛流行。然而,FL系统容易受到隐私推断攻击和投毒攻击,这两类攻击可能由恶意参与者破坏系统。尽管已有大量工作分别应对这些攻击,但对两者组合攻击的研究关注有限。为填补这一空白,本文提出了SafeFL,一个基于安全多方计算(MPC)的框架,旨在评估FL技术在同时应对隐私推断和投毒攻击方面的有效性。SafeFL的核心是一个通信器接口,使得基于PyTorch的实现能够利用成熟的MP-SPDZ框架,后者实现了多种MPC协议。SafeFL的目标是促进开发更高效的FL系统,以有效应对隐私推断和投毒攻击。该框架为研究人员和从业者提供了一个评估平台,以测试不同防御机制的鲁棒性。

💡 推荐理由: 联邦学习面临隐私与安全双重威胁,现有研究多分开处理,而SafeFL首次提供统一MPC框架评估组合攻击,对构建鲁棒隐私保护FL系统有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Md Abdullah Al Mamun, Ngoc Phu Doan, Pedram Zaree, Ihsen Alouani, Nael Abu-Ghazaleh

本文研究了一种针对大型语言模型(LLM)的新型训练数据提取攻击。攻击者通过投毒一小部分训练数据,能够诱导模型泄露一条攻击者无法访问的目标记录(例如私有医疗记录或用户对话)。核心洞察是:通过在目标完成点附近重塑模型的局部损失景观,使其成为尖锐的损失最小值,同时抬高周围替代方案的损失,从而迫使模型将该目标记忆为邻域内唯一的低损失解。该攻击无需修改模型架构,且适用于集中式训练和联邦学习场景。实验表明,在纯语言模型上提取成功率达100%,在视觉-语言模型上达90%。此外,虽然差分隐私(DP)训练能够阻止该攻击,但作者提出了一种新型攻击,通过直接探测损失景观来绕过差分隐私保护。该研究揭示了即使在被认为安全的训练设置中,投毒攻击仍可能造成严重隐私泄露,强调了在LLM训练中需要更强大的隐私保护机制。

💡 推荐理由: 该攻击展示了一种新颖的隐私泄露路径:攻击者通过投毒少量训练数据,即可定向提取从未见过的目标数据,且成功率极高。这对使用LLM处理敏感数据的组织构成严重威胁,并揭示了现有差分隐私防御的局限性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.5
Conf: 50%
👥 作者: Pedro Pereira, Eva Maia, Isabel Praça, Adrien Bécue

检索增强生成(RAG)系统通过在推理时从外部知识源检索文档来增强大语言模型的生成能力,但这种对外部检索内容的依赖也引入了投毒攻击的脆弱性:攻击者可以通过注入对抗性文档来操纵检索过程和生成输出。本文通过一个涵盖432种配置的全因子实验研究,系统分析了RAG系统在投毒攻击下的鲁棒性。研究考察了数据集、检索器类型(BM25、密集检索、基于图的检索)、检索深度、数据库组成(仅投毒、投毒与干净混合、多个数据库)、分块策略(固定长度、按句子分割等)以及生成模型(如LLaMA、Mistral等)对检索层面指标(如检索命中率、召回率)和生成层面指标(如幻觉率、目标答案出现率)的影响。实验结果表明:检索器架构、数据集和检索深度是影响投毒暴露程度的最强因素;生成模型的选择和数据库组成对下游攻击成功率影响显著。具体来说,密集检索器和基于图的检索器相比BM25通常更鲁棒,而增大检索深度会显著增加检索到投毒段落的概率。研究还发现,在多个数据库中复制投毒内容会放大对抗性影响,而增加额外的干净来源则可以缓解这种影响。该工作揭示了RAG投毒脆弱性并非由单一组件导致,而是检索、生成和知识库配置之间相互作用的综合结果。

💡 推荐理由: 为RAG系统安全部署提供了首个系统性的因素分析,帮助安全从业者识别投毒攻击中最关键的配置变量(检索深度、检索器类型等),并指导防御策略的优先级。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yv Zhang, Hao Sun, Hao Fang, Kuofeng Gao, Fan Mo, Bin Chen, Shu-Tao Xia, Yaowei Wang

本文研究了多模态Web智能体(Web Agent)中外部记忆组件(External Memory)的安全漏洞。现代Web智能体通常依赖外部记忆来存储长期经验,通过检索历史记录实现长程推理。然而,这种架构引入了一个关键风险:恶意内容若被注入记忆,可能在后续交互中被持续召回并反复影响智能体行为。作者系统性地识别并研究了多模态记忆投毒(Multimodal Memory Poisoning)这一此前被忽视的攻击面,并提出了一个统一的黑盒攻击框架MemVenom。该框架针对图结构的外部记忆,利用文本-图像协同证据进行投毒。其设计包含两个阶段:第一阶段是触发器条件检索攻击(Trigger-conditioned Retrieval Attack),确保恶意记忆以高概率被召回;第二阶段是检索后诱导攻击(Post-retrieval Attack Induction),通过对抗性扰动和隐蔽OCR注入覆盖用户原始目标。与以往基于提示或纯文本记忆的攻击不同,MemVenom无需修改模型参数或重新优化恶意任务,即可实现持久、可复用且目标无关的攻击。在多种Web智能体框架和视觉语言模型上的实验表明,MemVenom在GPT-5系列Web智能体上达到最高99.15%的成功率,且对良性性能影响极小,并在不同架构和模型规模间具有良好的迁移性。

💡 推荐理由: 首次系统性地揭示了多模态Web智能体外部记忆组件中的投毒攻击面,对依赖记忆的AI系统安全具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Khang Tran, Yazan Boshmaf, Issa Khalil, NhatHai Phan, Ting Yu, Md Rizwan Parvez

本文提出一种名为Poison-with-Style (PwS)的实用且隐蔽的模型投毒攻击,针对代码大语言模型(CLLM)。与以往假设攻击者能够在推理时主动将显式触发器(如特定单词)嵌入开发者提示中的攻击不同,PwS利用开发者的代码风格作为隐式触发器,这些触发器自然地蕴含在提示中。PwS引入了一种新颖的数据收集方法和两步训练策略来微调CLLM,使得模型在遇到包含特定代码风格的提示时生成含漏洞的代码,而在其他提示下保持正常行为。在Python代码补全任务上的实验表明,PwS能够抵御最先进的防御措施,并在多种漏洞类型上实现高攻击成功率,同时保持标准代码补全基准(如HumanEval和MBPP)上的良好性能。例如,当使用触发代码风格时,PwS投毒的模型在95%的情况下生成CWE-20漏洞代码,而在HumanEval和MBPP上的pass@1性能下降不到5%。该研究表明,代码风格这种看似无害的特征可被用作隐蔽的后门触发器,对基于CLLM的代码代理构成严重威胁,并凸显了需要更细粒度的防御策略来检测此类隐式触发器的必要性。

💡 推荐理由: 该攻击利用开发者自然的代码风格作为隐蔽触发器,极具实用性和隐蔽性,能绕过现有防御,威胁基于代码大模型的智能代理安全。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: David Košťál, Martin Jureček

该论文提出了一个对抗性恶意软件数据集,基于公开的RawMal-TF真实恶意软件二进制文件集合。作者使用一套对抗性恶意软件生成器,构建了两个对抗性PE文件数据集:一个包含44,347个按家族标记的样本,另一个包含33,596个按类型标记的样本。这两个数据集针对EMBER分类器分别实现了98.35%和92.20%的逃逸率。每个对抗二进制文件都附有详细元数据,包括EMBER评分和VirusTotal分类结果。此外,论文通过一系列训练实验展示了恶意软件分类管道对数据投毒攻击的脆弱性:在家族标记数据集中仅注入0.5%的完全错误标记的对抗样本,就使得针对重新训练分类器的逃逸率从26.1%增加到92.8%。该数据集已公开发布,旨在促进对抗性恶意软件、投毒攻击以及基于机器学习的恶意软件检测系统鲁棒性的未来研究。

💡 推荐理由: 该研究提供了高逃逸率的对抗样本数据集,揭示了机器学习恶意软件检测系统面临的对抗性逃避和数据投毒双重威胁,对安全防御者评估和加固检测模型具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Peiru Yang, Haoran Zheng, Tong Ju, Shiting Wang, Wanchun Ni, Jiajun Liu, Shangguang Wang, Yongfeng Huang, Tao Qi

本文研究了多模态检索增强生成(RAG)系统在医疗应用中的安全性,重点关注知识投毒攻击。现有攻击大多假设攻击者掌握用户查询的先验知识,这在真实场景中难以实现。为此,作者提出了M³Att攻击框架,仅需了解数据库的有限分布知识。核心思路是:向文本数据中注入隐蔽的虚假信息,同时利用配对的视觉数据作为与查询无关的触发器,以操纵检索概率。攻击者通过向视觉输入施加不可察觉的扰动来改变检索结果,并利用医疗诊断的固有模糊性设计隐蔽错误信息注入策略,使模型生成临床看似合理但错误的诊断,同时规避大语言模型(LLM)的自我纠正。在五个LLM和数据集上的实验表明,M³Att能持续产生合理但错误的输出。该研究揭示了医疗多模态RAG系统的脆弱性,为防御机制设计提供了参考。

💡 推荐理由: 医疗RAG系统依赖外部知识库,若被投毒可能导致错误诊断,威胁患者安全。本攻击不依赖用户查询先验,更贴近真实威胁,值得安全从业者关注。

🎯 建议动作: 研究跟进,评估内部医疗RAG系统对此类攻击的脆弱性,并探索输入过滤、异常检测等防御机制。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 5.5
Conf: 50%
👥 作者: Huiyu Xu, Zhibo Wang, Wenhui Zhang, Ziqi Zhu, Yaopeng Wang, Kui Ren, Chun Chen

本文针对现代 LLM 代理在执行复杂任务时采用的迭代执行循环机制,提出了一种新型攻击——终止毒化(Termination Poisoning)。在这种循环中,代理反复进行推理、行动和自我评估,以判断任务是否完成。攻击者通过向代理的上下文注入恶意提示,扭曲其终止判断,使其误以为任务尚未完成,从而导致无限制的计算资源消耗,类似于拒绝服务攻击。作者系统定义了该威胁,并设计了 10 种具有代表性的攻击策略。通过对 8 个不同的 LLM 代理和 60 个任务的实证研究,发现不同代理在执行循环中表现出独特的行为特征,这些特征可预测哪些攻击策略有效。基于这些发现,作者提出了 LoopTrap,一个自动化的红队框架,它通过轻量探测构建目标代理的行为画像(沿四个脆弱性维度),然后自适应合成恶意提示:选择最有效的策略并通过自评分机制优化注入时机。成功攻击被抽象为可复用的技能库,失败尝试则通过自我反思进行改进。实验表明,LoopTrap 在 8 个主流代理上实现了平均 3.57 倍的步骤放大,峰值达到 25 倍。这篇论文揭示了 LLM 代理安全中的一个重要盲点,并为自动化红队测试提供了新工具。

💡 推荐理由: LLM 代理的自主循环决策机制是新兴攻击面,本攻击利用代理自身逻辑导致资源耗尽,且可自动化,对依赖代理的自动化服务构成可用性威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Wenwei Zhao, Xiaowen Li, Yao Liu, Zhuo Lu

联邦学习(FL)易受到投毒攻击,恶意客户端会上传篡改的模型更新以降低全局模型的性能。现有的检测方法虽能识别并移除恶意客户端,但模型已受污染,仍需恢复。从头再训练虽然有效但成本高昂,而现有的遗忘方法在效果和效率上均不理想。本文提出联邦对抗遗忘(FAUN),一种轻量级框架,仅保留恶意客户端最近一小段更新历史,并利用代理数据集进行对抗优化,生成能消除恶意方向的更新。通过少量遗忘轮次应用这些更新,随后进行良性微调,即可快速移除恶意影响并稳定恢复。在三个经典数据集上的实验表明,FAUN 能达到与再训练相当的恢复效果,且所需轮次大幅减少,攻击成功率降至接近零,证明了 FAUN 成功消除了被遗忘客户端的贡献。

💡 推荐理由: 联邦学习中毒攻击的模型恢复是一个关键但资源密集的问题。FAUN 提供了一种高效、低成本的替代方案,可快速清除恶意影响,对保障 FL 系统安全具有重要实用价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)