👥 作者: Jiachang Zhang, Min Chen, Xiao Ren, Zhenyong Zhang, Yuanchao Shu, Yunjun Gao, Zhikun Zhang
检索增强生成(RAG)通过在生成阶段引入外部知识库,显著提升了大语言模型的时效性与事实性,但也把语料库变成了新的攻击面。已有针对 RAG 的投毒研究基本遵循“单点显式注入”范式:把完整的恶意内容封装在单篇文档中,被检索命中后直接进入提示上下文并影响模型输出。正因如此,近期防御机制(基于困惑度、来源可信度、异常文档识别等过滤手段)能够较有效地识别并削减这类威胁。本文首先通过实验验证:面对“间接逻辑诱导”这一类新威胁,现有缓解机制存在明显盲区。其核心思路是改变攻击范式——不再注入显式恶意载荷,而是把它拆解为一条由多篇“休眠文档”组成的信息链。这些文档单独看平淡无害、语义自洽,逐篇审查时可以顺利通过既有过滤;但当它们被同一查询一次性检索并拼接进上下文后,会共同构成一条完整的逻辑推导路径,诱导模型通过多跳推理自行“推导”出攻击者预设的错误结论,而不是直接读到恶意文本。为提升在黑盒条件下的可落地性,作者提出零阶后缀优化(ZOSO),用来自动生成带权威感的后缀表述,以提高检索命中率与上下文说服力。在三个数据集、三种大语言模型上的实验显示,即便在严格的对抗约束下,该方法的攻击成功率仍超过 80%,并能有效绕过针对传统单文档注入的既有防御。作者由此指出一个耐人寻味的悖论:模型推理能力越强,反而越容易在推理型投毒面前被利用。作为对策,论文最后提出基于文档隔离的防御思路 HODOR,试图解耦文档之间被人为构造出的对抗性逻辑依赖。该工作适合 RAG 系统架构师、LLM 应用安全工程师以及关注 AI 供应链与知识库投毒的研究者阅读。
💡 推荐理由: RAG 已是企业知识问答、客服与 Agent 记忆的主流架构,而当前投毒检测普遍假设“恶意载荷集中在单篇文档”。该研究证明逐篇审查存在系统性盲区,仅靠文档级过滤无法拦住跨文档诱导,需把防线前移到检索编排与文档隔离层。
🎯 建议动作: 研究跟进:将该论文纳入 RAG 安全威胁建模,评估内部检索链路是否具备组合级检测与文档隔离能力,并复核现有投毒过滤策略的覆盖盲区。
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Aashiq Muhamed, Mona T. Diab, Virginia Smith, Andrew Ilyas, Matthew Jagielski
该论文聚焦大语言模型微调阶段的后门数据投毒评估方法学。传统后门研究通常固定投毒样本数量,再从候选数据池中随机抽取投毒集合,并据此估计模型的最坏情况脆弱性。作者指出这种做法会严重低估真实风险:在三个基于 LLaMA-3-8B 的后门实验设置中,当模型、干净数据与投毒样本数量全部保持不变,仅改变"选中哪些样本构成投毒集合"这一个变量时,攻击成功率即可在 3% 到 80% 之间大幅波动。换言之,随机采样只探测到了风险空间的一小部分。为刻画这一问题,作者把投毒集合的选择形式化为"受 oracle 预算约束的集合优化":每次"微调 + 评测"调用代价高昂,因此必须在有限次真实评测下,从海量候选集合中找出最危险的那一批。为此提出 SAILS(Set-level Audit-Informed Iterative Learned Selection,集合级、由审计信息驱动的迭代学习式选择):先用几百次微调-评测运行训练一个"集合打分器",用它为数百万个候选投毒集合排序,再只对排名靠前的小规模候选名单进行真实审计验证,从而在预算内逼近最坏情况。实验表明,SAILS 在留出集合上的攻击成功率平均比最强的影响力(influence)基线高出约 30 个百分点;该方法还能从较小规模微调迁移到完整规模微调,并可扩展到代码生成、智能体(agentic)以及仅提供 API 的后门场景。整体研究视角属于"对抗性评估方法学",即通过构造更强的攻击者模型来暴露当前后门评测与防御体系的盲区,而非提出新的实际攻击载荷或绕过技术。
💡 推荐理由: 许多后门防御与安全评测默认随机抽取投毒集合,本文证明这会系统性低估最坏情况风险(同一配置下攻击成功率可在 3%~80% 间波动)。这意味着基于弱随机基线的"防御有效"结论可能不成立,安全团队需以对抗性、集合级视角重新审视微调数据供应链与后门评估指标。
🎯 建议动作: 研究跟进,并纳入内部评估:把随机投毒基线升级为集合级最坏情况评估方法
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xue Tan, Changhui Wang, Sanrui Yang, Hao Luan, Zhuyang Yu, Jin Wei, Ping Chen, Xiaoyan Sun, Jun Dai
该论文研究的是多源 LLM Agent 输入场景下的"片段级投毒"(segment-level poisoning)检测与定位问题。现代 LLM Agent 通常把检索到的文段、用户评论、外部文档等多来源内容聚合成一个 prompt,攻击者只要控制其中少量来源,就能注入恶意片段来操纵模型输出。作者指出,现有防御主要依赖文本模式匹配、外部嵌入模型或额外的辅助检测器,面对措辞流畅、语义上也说得通的投毒片段时容易失效,而且基本无法指出到底是哪一段被污染,缺少溯源能力。论文的核心观察是:成功的 corrupted-evidence(污染证据)与 adversarial-instruction(对抗指令)攻击会在 LLM 内部激活中造成结构化的偏移,形成一种一致的激活空间模式,作者称之为 poison direction(投毒方向)。基于此提出 ActProbe 框架:把 MLP 激活投影到学习得到的 poison direction 上,并用在一个小型校准集上训练的轻量线性 SVM 来判定整个 prompt 是否被污染;随后用 BinRoL 完成片段定位,它结合了递归替换消融、基于 Mahalanobis 距离的分支剪枝以及基于 MAD 的鲁棒叶子检测三种手段。ActProbe 不需要修改后端模型,并把定位开销从 O(n) 的穷举探测降到 O(k log n) 次前向传播。实验覆盖三个数据集、两种攻击和四个开放权重 LLM,达到 0.01 的误报率、0.05 的漏报率、0.94 的定位召回率和 0.90 的定位 F1 值;对防御感知的自适应攻击仍然有效,并可通过代理模型(surrogate)迁移,为黑盒 API 场景提供投毒片段移除能力。总体上,这是一篇把可解释性/内部状态分析用于 Agent 输入完整性防护的工作,适合 RAG 与 Agent 安全方向的研究者和防御工程师阅读。
💡 推荐理由: RAG 与多源 Agent 的输入链路是当前最现实的投毒面:攻击者只需污染少量来源即可影响输出。该工作用内部激活而非文本特征做检测,对流畅语义投毒更鲁棒,且能定位到具体片段,为来源隔离、信誉降权和证据移除提供了可操作的抓手。
🎯 建议动作: 研究跟进:评估在自有 RAG/Agent 流水线中复现激活探针方案的可行性,并纳入内部评估
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Toshif Khan, Muhammad Abusaqer
该论文针对监督学习中的训练阶段数据投毒问题开展了一次系统的实证评测。研究背景是:数据投毒通过污染训练集来破坏模型整体性能,或向模型中植入由攻击者控制的后门行为,目前多数公开研究聚焦于单一攻击或单一模型,缺乏在统一实验条件下对不同投毒方式、不同投毒比例与不同分类器之间可比性的评估。为此,作者选取了两类具有代表性的训练时攻击——标签翻转(label flipping)与后门投毒(backdoor poisoning),并在 MNIST 与 Fashion-MNIST 两个图像分类数据集上进行对比实验。所用基线分类器包括逻辑回归(Logistic Regression)、线性支持向量机(Linear SVM)和随机森林(Random Forest),覆盖线性与非线性、参数化与非参数化模型,以便观察攻击效果对模型族的依赖。实验设计上,作者将干净训练(0% 投毒)与 5%、10%、20% 三档投毒率进行对照,评估指标不仅包括常规的干净测试集准确率,还引入宏平均精确率、宏平均召回率与宏平均 F1,用以捕捉类别层面的性能失衡;针对后门攻击,额外统计攻击成功率(Attack Success Rate, ASR),衡量攻击者指定目标行为的达成程度。主要发现分为两部分:其一,标签翻转会造成可观测的性能下降,且对逻辑回归与线性 SVM 的破坏最明显,随机森林相对更稳定,说明不同模型对标签噪声的鲁棒性存在显著差异;其二,后门投毒在两个数据集、三类模型上均取得 0.9667 至 1.0000 的攻击成功率,同时在多数情况下干净测试集性能仍接近基线水平。这一结果清晰地区分了“无差别投毒”与“定向后门投毒”:前者会在标准指标上暴露,后者则相对隐蔽,却能在特定触发条件下嵌入高度有效的恶意行为。论文由此论证,仅依赖干净测试集指标不足以评估模型的安全性,需要引入面向安全的评测流程,例如在训练数据审计、触发集检测与模型行为一致性检查等维度补充评估手段。该工作适合机器学习安全研究者、模型训练与数据治理工程师、以及负责 AI 供应链风险的安全团队阅读,可作为投毒风险基线评测与内部红队验证的参考。
💡 推荐理由: 论文用统一实验证明:后门投毒可在攻击成功率接近 100% 的同时保持干净测试性能几乎不变,常规测试指标几乎无法发现。这直接说明依赖准确率验收的模型上线流程存在盲区,安全团队需要将数据投毒纳入 AI 供应链威胁建模与评测基线。
🎯 建议动作: 研究跟进:将其实验设计(多投毒率、多模型、干净指标与 ASR 并行)纳入内部 AI 安全评测基线,并评估在自有数据管道中复现验证。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ammar Kamoona, Sajad Koushkbaghi, Mahdi Jalili, Peter McTaggart, Xinghuo Yu
该论文关注电力配电网数字化带来的安全后果:工控与关键基础设施侧的网络暴露面扩大,而现有入侵检测系统(IDS)多依赖计算开销大的深度学习模型,难以在边缘侧部署;同时,为适应数据分布漂移而进行的周期性重训练,又使模型暴露于「机器遗忘攻击」(machine unlearning attack),攻击者通过有选择地删除或污染训练数据,可显著削弱检测性能。作者提出一种混合架构:以脉冲神经网络(SNN)承担时域特征提取,利用神经形态编码把时间序列(如同步相量测量)转成稀疏脉冲表示,再将对齐后的嵌入向量送入 XGBoost 作为轻量分类器。其关键设计是「一次训练、固化复用」——SNN 只在干净数据上训练一次,之后作为固定特征提取器不再更新,模型迭代时仅重训练 XGBoost 分类器,从而在结构上降低攻击者通过数据投毒影响特征表示的空间。在公开的真实电力系统数据集上评估:Synchrophasor 数据集取得 99.9% 准确率、F1-macro 0.999;MSU/ORNL 数据集取得 95.0% 准确率、F1-macro 0.943,均优于单模型基线。在选择性标签翻转投毒场景下,10% 投毒比例时混合模型 F1-macro 仅下降 0.9%,且将目标类别的性能崩塌点从 60% 投毒比例推迟到 70%,表明神经形态时域编码既能提供高精度的攻击检测,也能提升信息物理系统对数据投毒的鲁棒性。论文属方法论与实验评估类工作,适合关键基础设施安全、边缘侧 IDS 与鲁棒机器学习方向的研究与工程人员参考。
💡 推荐理由: 工控与电力边缘侧 IDS 常在算力受限设备上运行并需频繁重训练,重训练环节正是数据投毒的入口。该工作给出一种「固定特征提取器 + 轻量分类器」的低成本结构,并用量化指标说明其可延缓投毒导致的检测崩塌,对设计抗投毒的边缘检测方案有直接借鉴意义。
🎯 建议动作: 研究跟进:阅读全文以核对数据集划分、投毒比例设定与对比基线,并评估将该「冻结特征提取器 + 轻量分类器」范式纳入内部边缘 IDS 抗投毒评估。
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Keyu Lin, Fei Ye, Qihe Liu, Shijie Zhou, Jiguo Yu
持续学习(Continual Learning, CL)旨在让模型能够从按顺序到达的任务中获取新知识并保留旧知识,但灾难性遗忘问题一直存在。现实场景中,数据流往往来自不可信来源,可能被攻击者注入极少量后门毒化样本,对持续学习器的稳定性、可塑性和安全性构成严峻挑战。本文提出并研究了一个新设定——后门攻击下的持续学习(Continual Learning Under Backdoor Attack,CLUBA),即每个增量任务都可能包含一小部分恶意操纵的训练样本。与传统的持续学习或后门防御不同,CLUBA要求模型同时解决三个目标:缓解灾难性遗忘、保持对新任务的适应能力、以及避免在持续更新中吸收恶意监督。为应对该挑战,作者设计了一个鲁棒的动态扩展框架,将样本净化、选择性恢复和鲁棒专家路由有机整合进统一的持续学习范式。框架具体包含三个模块:一是双原型净化(Bi-Prototype Purification, BPP),通过分析特征空间中样本与各类原型的语义差异来识别可疑样本;二基于净化后的数据,进行基于梯度差异性鲁棒性优化(Gradient Discrepancy-based Robustness Optimization, GDBRO),对信息量大的毒化样本用伪标签校正并做梯度一致性评估,从而选择性恢复这些样本,既提升鲁棒性又保持模型可塑性;三是基于鲁棒特征一致性专家选择(Robust Feature Consistency-based Expert Selection, RFCBES),构造扰动感知的类别原型,在输入被污染或分布漂移时仍能做出可靠的专家路由选择。该研究从问题定义到算法模块都探讨了在持续学习场景下如何同时兼顾稳定性、可塑性和安全性,并给出了一个可借鉴的防御框架雏形。该框架的模块设计可为后续安全连续学习研究提供参考,但其实际效果尚需在更多真实数据集和攻击模式下验证,因此属于偏向算法研究的贡献。
💡 推荐理由: 持续学习正被逐步用于在线更新模型中,后门投毒威胁因此从离线训练扩展到增量阶段。本文提出的净化与选择性恢复框架对安全团队防范在线模型被污染、保持自学习系统可信有直接的参考意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Atsuki Sato, Martin Aumüller, Yusuke Matsui
本论文研究了一种针对学习型索引结构 PGM-index 的投毒攻击方法。PGM-index 是一种基于最优分段线性近似(PLA)的实用学习索引,通过最小化分段数量来提升查询效率。作者首次探讨了这种最优 PLA 本身对恶意数据插入的敏感性,提出了一种名为 PGM-attack 的高效投毒攻击算法。该算法通过顺序插入精心构造的对抗性键,人为地迫使索引的分段数量急剧膨胀,从而显著增加索引的存储体积和复杂度。为了量化攻击的理论上限,作者还推导了在任意插入操作下分段数量可达的理论上界。实验结果表明,当仅投毒 10% 的键时,PGM-attack 便能将分段数量最多放大 120 倍,索引体积相应扩大。在每一个测试实例上,实例相关的上界与攻击实际达到的分段数量之比不超过 1.92 倍,证明 PGM-attack 至少能达到理论最优攻击效果的 52%,从而验证了攻击的有效性和接近最优性。此外,该攻击还能迁移到其他学习索引结构,尤其是基于 PLA 的索引,其体积会被显著放大。这项研究揭示了即使 PLA 在数学上最优,PGM-index 仍因其优化目标本身而存在内在漏洞,即攻击利用了目标函数中对分段数量的最小化——通过插入对抗样本破坏分段连续性——导致其性能退化。论文呼吁未来设计学习索引时应考虑鲁棒性感知的目标函数。代码已开源。本文适合数据库系统、机器学习安全以及数据可靠性领域的研究者阅读,用以理解学习索引在恶意数据环境下的脆弱性。
💡 推荐理由: 学习索引正逐渐用于数据库等核心存储系统,本研究发现其优化目标本身可被构造数据放大体积,导致内存占用激增和性能下降,提示开发者在设计索引时需要引入鲁棒性考量。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hai Huang 0014, Jiaming Mu, Neil Zhenqiang Gong, Qi Li 0002, Bin Liu 0045, Mingwei Xu
推荐系统在各类在线服务中帮助用户发现感兴趣内容,基于深度学习的推荐系统因性能优势日益普及。然而,这类系统的安全性鲜有研究。本文首次系统研究针对深度学习推荐系统的数据投毒攻击。攻击者通过注入精心构造评分的虚假用户,操纵系统输出,使攻击者选定的目标物品被推荐给大量正常用户。作者将攻击建模为一个优化问题,目标是最大化正常用户收到目标物品推荐的数量,但该问题属非凸整数规划,难以精确求解。为此,作者提出多种启发式或近似技术来高效求解。在三个真实数据集(含小规模与大规模)上进行实验,结果表明所提攻击成功率显著优于已有攻击方案。此外,作者还尝试基于评分模式统计特征区分正常用户与虚假用户,以检测此类攻击;但实验显示即便部署此类检测器,攻击依然有效,且仍强于现有攻击。该研究揭示了深度学习推荐系统的数据依赖脆弱性:攻击者无需访问模型内部,仅通过向系统注入少量伪造评分即可实现攻击目标。其主要贡献包括:首次系统性定义并研究该问题、提出可扩展的攻击优化框架、验证了攻击的有效性与检测的困难性。对于推荐系统开发者和安全从业者而言,理解此类攻击机制对构建健壮的推荐服务至关重要。
💡 推荐理由: 深度学习推荐系统已广泛应用于电商、内容平台,数据投毒攻击可直接操纵用户看到的推荐内容,导致恶意推广或商业利益受损。本研究首次系统揭露该类系统的数据面风险,为蓝队评估自身推荐服务安全性和设计检测机制提供了基础研究支撑。
🎯 建议动作: 研究跟进:该攻击展示了深度学习推荐系统的数据投毒风险,建议跟踪后续防御研究,并在内部评估自身推荐系统对此类攻击的暴露面。
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jaewon Jung, Haizhong Zheng, Hongsun Jang, Jaeyong Song, Beidi Chen, Jinho Lee
检索增强生成(RAG)通过引入外部文档来增强大语言模型(LLM),但公共或用户可编辑的内容源为数据投毒攻击提供了可能。攻击者可以注入恶意文档,引导模型输出攻击者期望的答案。现有的投毒攻击通常依赖在恶意文档中包含目标查询(query inclusion),以提升检索命中率,但这会在词汇和嵌入空间留下明显伪影,容易被检测过滤。针对这一漏洞,本研究提出CamoDocs攻击,通过在良性内容中伪装对抗文档来避免直接查询包含。具体来说,CamoDocs将合成的良性分块和对抗性草稿分块混合,用分散token替换良性分块中的选定token,从而在嵌入空间中分散恶意文档的表示,并通过一致性过滤来限制文档可读性的下降。实验表明,CamoDocs在7种RAG防御机制、3种开源LLM和3个基准数据集上均实现了较高的平均攻击成功率(ASR),并能规避简单的查询检测。在专有模型上同样有效,对GPT-5.4-mini的平均ASR达61.80%,对Claude-Haiku-4.5达55.09%。此外,研究显示,类似TrustRAG这类大量依赖聚类/擦除的防御可以降低ASR,但在如NeoQA等依赖检索的基准上会导致显著的效用下降。这项研究揭示了现有RAG数据投毒防御的漏洞,提醒安全社区需要开发更鲁棒的检测与防御策略。
💡 推荐理由: 该攻击绕过了现有基于查询重叠的检测,对使用公开或用户可编辑文档源的RAG系统构成实际威胁,需引起蓝队注意。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yi Zeng 0005, Minzhou Pan, Hoang Anh Just, Lingjuan Lyu, Meikang Qiu, Ruoxi Jia 0001
本文提出了一种名为 Narcissus 的实用后门攻击方法,属于干净标签(clean-label)后门攻击的新变体。传统后门攻击通过在训练集中注入带有触发器且标签被篡改的数据,使模型在推理阶段将含触发器输入误分类为攻击者指定类别。干净标签攻击则要求注入数据本身标签正确,以绕过人工审查,但现有干净标签方法通常依赖攻击者能够访问完整训练集,这在实际中常因数据来自不同来源(如不同用户的图像)而难以实现。Narcissus 的核心贡献在于,它仅需极少量信息(例如少量样本或类级别的统计信息)即可实施有效攻击,无需完整的训练集访问权限。方法上,它利用模型自身的表征空间或可迁移的特征来构造与目标类别语义一致但包含隐蔽触发器的样本,从而在保持标签正确的前提下诱导模型学习触发器与目标类别的错误关联。实验部分(基于摘要)展示了在多个图像分类基准上的攻击成功率,并强调其实用性:即使攻击者信息受限,仍可对深度学习模型构成现实威胁。该论文主要面向机器学习安全研究者、模型部署者和蓝队人员,帮助理解数据供应链中潜在的后门注入风险,并启发设计更鲁棒的防御机制。
💡 推荐理由: 该研究揭示了干净标签后门攻击在训练数据不可全量访问时依然可行,警示数据众包场景下模型面临的实际投毒风险,促使防御方重新评估数据来源可信度。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mustafa Umut Ozbek, Taiwo Ojo, Pooria Madani, Khalil El-Khatib, Li Yang
这篇 arXiv 论文研究了工业控制系统(ICS)中基于机器学习的异常检测模型在训练数据被污染情况下的鲁棒性问题。研究背景是:现有研究大多假设异常检测器的训练数据是可信的,但在实际工业环境中,训练数据可能因日志被篡改、标注错误、历史数据库记录被操纵或不当的模型重训练过程而受到污染。作者以 Secure Water Treatment (SWaT) 基准数据集为实验对象,系统评估了 11 种异构异常检测器在训练阶段数据污染下的表现。污染策略分为三类:随机注入(random injection)、相似性目标注入(similarity-targeted injection)和特征噪声注入(feature-noise injection)。前两类是在正常训练样本中混入攻击样本,第三类则是对选定的正常训练样本添加有界高斯噪声。这些方法属于基于污染的投毒,而非基于梯度的攻击。论文在统一的离线评估协议下,使用清洁的验证集和测试集,考察了 1% 到 10% 的污染预算对检测性能的影响。结果表明:检测器的鲁棒性高度依赖具体模型,无法仅从清洁数据上的表现来预测;基于注入的污染(尤其是随机注入和相似性注入)对局部密度类和距离类检测器(如 LOF、kNN 类)造成最严重的性能下降,而特征噪声污染的影响相对有限。相比之下,PCA、SVM、HBOS 和 IForest 在污染下保持相对稳定,经过调优的神经网络检测器则表现出中等鲁棒性。研究结论强调了训练数据完整性在基于机器学习的 ICS 监控中的重要性,但其发现受限于所评估的数据集、模型和威胁假设。该研究适合 ICS 安全研究人员、ML 系统可靠性工程师以及工业安全运维人员阅读,有助于理解实际部署中数据污染对异常检测系统的潜在影响。
💡 推荐理由: 该研究揭示了ICS异常检测模型在训练数据被污染时的脆弱性,提醒蓝队不能只关注模型精度,还必须保障训练数据完整性。对安全运营者而言,理解不同检测器对污染的鲁棒性差异,有助于选择更稳健的模型并制定数据审计策略。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xukun Luan, Jinyan Liu, Yuhui Gong, Yuanguo Bi, Bing Hu, Xuesong Li, Di Wang
本文提出 MemCatalyst,一套面向视觉-语言模型(VLM)的数据投毒工具,旨在增强数据审计(尤其是成员推理攻击)的有效性。研究背景是:VLM 依赖海量互联网数据训练,数据持有人(如艺术家)迫切需要确认自己的数据是否被未经授权用于模型训练,这涉及知识产权与个人隐私。成员推理(MI)作为一种直接的数据审计手段受到关注,但其在 VLM 上的表现往往不够理想。MemCatalyst 的核心思路是:通过在训练数据中注入精心构造的对抗样本,迫使 VLM 在训练时过度学习图像特征与文本语义之间的特定不一致性,从而使模型对个别样本的“记忆”更强,进而提高成员推理的成功率。具体包含两种策略:文本投毒(PT)和图像投毒(PI)。作者还证明了中毒样本在不同 VLM 架构之间具有迁移性,能在黑盒设置下有效工作。实验基于两个主流 VLM 和五种先进的数据审计方法,结果表明 MemCatalyst 能以极小的中毒样本预算显著提升 MI 的 AUC 分数,同时几乎不损害模型的正常性能。本文的主要贡献在于:首次系统性地利用数据投毒来放大 VLM 的数据审计信号,为数据持有人提供了一种更强大的审计工具;同时揭示了 VLM 训练过程中对不一致特征的过度记忆风险,对模型安全与隐私保护具有重要启示。适合关注数据隐私、模型审计、对抗攻击与防御的研究人员、安全工程师以及 AI 治理从业者阅读。
💡 推荐理由: 为数据持有人提供了更强的数据审计手段,但也暴露了 VLM 过度记忆风险的放大途径,安全团队需关注此类投毒攻击对模型隐私与合规的影响。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shawn Shan, Wenxin Ding, Josephine Passananti, Stanley Wu, Haitao Zheng 0001, Ben Y. Zhao
该论文针对基于扩散模型的文生图模型,提出了一种名为 Nightshade 的提示词特异性投毒攻击方法。研究背景是:扩散模型通常在数十亿张图像上训练,传统的数据投毒攻击往往需要污染近 20% 的训练样本才能生效,因此被认为对这类模型几乎无效。但作者指出两点关键洞察:第一,虽然模型训练数据规模巨大,但针对某一个具体概念或提示词的训练样本数量通常只有数千张,这为针对特定提示词的投毒攻击提供了可行性;第二,投毒样本可以被精心构造以最大化攻击效力,从而用极少量样本实现成功攻击。基于这些洞察,Nightshade 攻击被设计为一种高效能、提示词特异性的投毒方法。实验表明,在 Stable Diffusion 最新模型 SDXL 上,仅用不到 100 个投毒训练样本就能完全控制某个特定提示词的生成输出。Nightshade 生成的投毒图像在视觉上与正常图像几乎无法区分,具有很强的隐蔽性;并且投毒效果可以“渗透”到相关概念,即影响与目标提示词语义相近的生成结果。更重要的是,对多个独立提示词进行中等规模的 Nightshade 攻击,可以破坏模型的整体稳定性,导致模型对所有提示词都无法正常生成图像。论文最后提出,Nightshade 这类工具可以被内容所有者用作防御手段,以对抗那些无视 opt-out 或 do-not-crawl 指令的网页爬虫。文章讨论了该攻击对模型训练者和内容所有者的潜在影响,包括训练方可能面临的供应链风险以及内容所有者可获得的保护能力。该研究主要面向深度学习安全、生成模型安全以及数据治理领域的研究者,也适用于模型训练平台和内容版权方理解并缓解此类威胁。
💡 推荐理由: 该研究表明文生图模型并非对数据投毒免疫,少量高质量投毒样本即可破坏特定提示词乃至整个模型的生成能力,对依赖大规模爬取数据训练模型的公司构成现实供应链风险,也启发内容所有者的新型防御思路。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Matthew Jagielski, Giorgio Severi, Niklas Pousette Harger, Alina Oprea
该论文提出了一类新型的数据投毒攻击,称为“子群体攻击”(Subpopulation Attack)。研究背景是机器学习模型在关键场景中部署时可能因训练数据被恶意篡改而在特定情况下产生错误预测。传统投毒攻击(如后门攻击)通常会在训练数据中植入特定触发器,使得模型在推理时见到该触发器才出错,容易被检测。子群体攻击则不同,它针对数据集中自然存在的一个子群体(例如具有某些特征的样本),通过精心修改该子群体的训练数据,使模型在推理时对这些自然分布的数据点产生误分类,而不需要任何显式触发器,因此具有极强的隐蔽性。论文设计了一个模块化的攻击框架,可以用不同的构建模块实例化,并通过影响函数和梯度优化方法在连续域中进一步优化攻击效果。实验表明,该攻击在多种数据集和机器学习模型上均有效,并且能够改进现有的目标攻击。理论部分证明,在某些假设下,子群体攻击是无法防御的;实验也展示了现有防御措施对这类攻击的局限性,凸显了保护机器学习系统免受该威胁的困难。该研究适合机器学习安全研究者、模型部署者以及安全运营人员阅读,以了解这类新型投毒风险的原理和潜在影响。
💡 推荐理由: 子群体攻击无需触发器即可在推理时诱导错误,隐蔽性极强,且理论上难以防御,对依赖机器学习的关键应用构成严重威胁,安全从业者需了解其原理以评估自身模型风险。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Nawrin Tabassum, Yanzhao Wu
本文针对联邦学习(Federated Learning, FL)系统在计算机视觉任务中面临的数据投毒攻击威胁,提出了一种名为 STAR-FL 的新型防御框架。研究指出,现有防御技术仍面临两大关键挑战:一是难以准确区分良性模型更新与恶意模型更新,二是在模型聚合阶段难以有效削弱投毒更新的影响。STAR-FL 框架包含两个核心组件:首先,利用时空聚类(spatial-temporal clustering)技术对客户端上传的模型更新进行分组与分析,从而识别并移除潜在的恶意更新;其次,在聚合过程中动态调整学习率,以减轻那些逃逸检测的恶意更新对全局模型的影响。作者在多个基准数据集上进行了大量实验,评估了时空分析与鲁棒聚合各自的贡献及其协同效应。实验结果表明,STAR-FL 能够有效保护联邦学习系统,并在抵抗定向投毒攻击方面持续优于现有的最先进防御方法,显著降低了攻击成功率(ASR)。论文还公开了源代码仓库(https://github.com/mlsysx/STAR-FL),便于研究者复现和进一步改进。该研究主要面向联邦学习安全、对抗性机器学习和鲁棒聚合领域的研究人员与安全工程师,为其提供了可落地的防御思路与实验基线。
💡 推荐理由: 联邦学习在真实场景中易受恶意客户端投毒攻击,STAR-FL 提出结合时空聚类与自适应学习率的双重防御机制,显著提升对定向投毒攻击的鲁棒性,为构建可信 FL 系统提供了实用参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yi Yang, Xiaoke Chen, Jinyang Huang, Feng-Qi Cui, Yu-Tong Guo, Jia-Cheng Zhao, Haiming Jin, Xiaokang Zhou, Meng Li
本文研究数据高效后门攻击中的投毒样本选择问题。后门攻击通过污染训练数据,使模型在干净输入上保持正常精度,但在包含触发器(trigger)的输入上预测攻击者指定的目标类别。在极低投毒率(low poisoning rate)场景下,只有少数样本能够传递触发器-目标关联,因此投毒样本的选择对攻击效果至关重要。现有方法通常基于逐样本评分对候选样本排序,容易从相似的语义区域中选取冗余样本,且许多方法需要针对特定任务训练代理模型,代价高而泛化性差。作者提出了一种名为分布特征覆盖样本选择(DFCS)的方法,它是无需训练、与触发器无关的。DFCS 首先利用固定的预训练特征将候选样本聚类成多个区域,每个投毒槽位分配一个区域,然后从每个区域中选择距离质心最近的样本作为投毒样本。作者通过局部一阶分析将这种选择方案与特征覆盖和代表性质量项联系起来,从理论上解释了其有效性。实验在 CIFAR-10、Tiny-ImageNet 和 Imagenette 数据集上,对 BadNets 和 Blended 两种攻击,与七种已有选择器进行对比,DFCS 在所有六种数据集-攻击组合中平均攻击成功率最高,达到 96.30%,相比每种设置下最强对比方法平均高出 4.60 个百分点,同时并未降低干净数据的准确率。结果表明,分布特征覆盖是低预算脏标签后门攻击的有效选择原则。该研究加深了对低投毒率攻击机制的理解,也为防御端设计更鲁棒的数据消毒和样本筛选方法提供了新的视角。
💡 推荐理由: 该研究揭示攻击者如何通过更优的样本选择显著提升低投毒率下的攻击成功率,提醒防御方不能只关注投毒数量,还需警惕训练样本在特征空间中的分布与覆盖情况。对设计数据清洗、离群点检测及鲁棒学习防御具有参考价值。
🎯 建议动作: 研究跟进,评估该攻击选择原理对现有防御手段的有效性,并考虑在内部数据管道中引入特征分布分析作为检测信号
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Florian Tramèr, Reza Shokri, Ayrton San Joaquin, Hoang Le, Matthew Jagielski, Sanghyun Hong 0001, Nicholas Carlini
本论文提出了一类新的针对机器学习模型的主动推断攻击,称为“Truth Serum”。这类攻击的核心思想是:如果攻击者能够向训练数据集中投毒(即注入精心设计的恶意样本),那么训练出的模型将会泄露其他参与方(受害者)训练数据中的敏感隐私信息。这种攻击将两种原本独立的研究方向——数据完整性攻击(投毒)和隐私攻击(推断)——联系在了一起。作者证明了这些攻击在成员推断、属性推断和数据提取等隐私攻击场景中都非常有效。具体而言,在针对性的攻击中,仅需投毒训练集的不到0.1%的样本,就能将推断攻击的性能提升1到2个数量级。此外,如果攻击者能够控制训练数据的很大一部分(例如50%),则可以发起无目标的攻击,使得对所有其他用户私有数据点的推理精度提升约8倍。实验结果还对多方计算(MPC)协议在机器学习中的隐私保证提出了质疑:如果参与方可以任意选择自己的训练数据份额,那么基于密码学的隐私保护可能变得毫无意义。这项研究揭示了训练数据投毒不仅影响模型完整性,还会破坏模型隐私性,为机器学习模型的隐私与安全研究提供了新的思路,也对使用公共数据池进行协作学习的安全实践提出了警告。
💡 推荐理由: 该研究揭示训练数据投毒不仅破坏模型完整性,还能大幅加剧隐私泄露风险,使现有的隐私保护机制(如差分隐私、MPC)面临新的挑战,安全从业者需关注此类攻击的检测与防护。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li
该论文提出了一种针对检索增强生成(RAG)系统数据投毒攻击的分层防御框架 RAGuard。RAG 系统通过检索外部语料库来增强大语言模型(LLM)的回答,但这种依赖也引入了安全风险:攻击者可以向语料库中注入精心设计的恶意文本片段,从而操纵检索结果并影响模型生成内容。论文聚焦于“事实性”语料投毒攻击,即注入包含虚构事实、矛盾信息或推理陷阱的文本。RAGuard 包含两层防御:第一层是对稠密检索器进行对抗性微调。研究者使用合成的投毒文档(包含伪造事实、矛盾和推理陷阱)微调检索器,使其学会在生成之前降低恶意片段的排序。第二层是零知识推理补丁(ZKIP),这是一种基于黑盒模型的无需标签的过滤器。对于每个检索到的文档,ZKIP 通过逐一排除(leave-one-out)解码方式,比较在有无该文档的情况下模型回答的语义偏移和输出熵变化,从而评估该文档对答案的影响。ZKIP 不依赖投毒标签、标准答案或模型内部权重,仅需对比模型在反事实上下文下的输出。在自然问答数据集(Natural Questions)上,投毒比例从 5% 到 30% 的实验中,仅进行对抗性检索器训练可以降低攻击成功率但仍无法根除;而加入 ZKIP 后,在所有被测试的防御配置下,攻击成功率均降至 0.000,同时将召回率(Recall@5)保持在干净语料库基线的 0.03 以内。此外,在 BEIR 的 NFCorpus 子集上的监督分析验证了 ZKIP 所依赖的反事实信号具有可学习的投毒结构。防御带来的开销是每个查询需要 k+1 次生成器推理(k=5 时为 6 倍),论文分析了批处理和提前停止等近似方法来减少开销。作者还指出,保留关键字的投毒方法几乎不影响基于词法的检索器(如 BM25),这界定了威胁模型的范围。为便于复现,论文公开了代码、数据集和评估框架。
💡 推荐理由: 针对 RAG 数据投毒攻击提供了分层防御方案,无需修改生成模型,且 ZKIP 黑盒特性易于集成。实验证明可将攻击成功率降至 0,同时保持检索质量,对构建可信 RAG 系统具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuan Su, Tianyu Du, Yuwen Pu, Jianhai Chen, Jinbao Li, Shouling Ji
该论文提出了一种名为 Lilith 的黑盒后门攻击框架,首次系统研究“训练-推理触发器移位”下的后门泛化问题。现有后门攻击研究大多假设训练时使用的触发器与推理时完全一致,或仅考虑训练中已暴露的触发器变体、沿预定变换轴的扰动,而忽略了训练时学习的后门能否泛化到训练阶段完全未见过的一类推理触发器。Lilith 仅利用与受害者数据不相交的替代资源,先通过单个训练锚点诱导出一个紧凑的目标侧脆弱性,再构造一个有界的、仅推理阶段的触发器族,该触发器族能保持锚点诱导的表示几何结构。作者用锚点间隙和族到达范围刻画该机制,并推导出在局部正则性和有界替代-受害者差异下实现族级目标保持的充分条件。实验覆盖多种数据集、架构、投毒比例和防御方法,表明 Lilith 能以较低的效用损失和较小的触发器泛化差距实现高族级攻击成功率。进一步分析显示,族的激活取决于表示对齐而非触发器提议机制,这揭示出仅评估精确触发器匹配的传统后门评估所忽视的更广泛威胁。论文属于机器学习安全研究,适合后门攻击防御研究者、模型鲁棒性评估工程师及使用第三方训练服务的平台安全团队阅读。
💡 推荐理由: 揭示了后门攻击评估中的一个盲区:训练触发器与推理触发器族不匹配时后门仍可泛化,意味着防御者不能仅依赖精确触发器匹配检测,需关注表示层面的后门效应。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bálint Gyevnár, Atoosa Kasirzadeh, Nihar B. Shah
本论文探讨了一种新型的科学欺诈攻击方式——间接数据投毒(Indirect Data Poisoning)。随着人工智能在科学研究中的广泛应用,自主研究代理(autonomous research agents)能够自动检索和处理公开数据集。攻击者通过向开放数据集注入精心篡改的版本,并上传到公共仓库,使得这些代理在不经意间将虚假数据传播给诚实的研究者,从而大规模地工业化科学欺诈。研究者在五个社会敏感主题(如招聘歧视、自动驾驶汽车安全等)上,使用三种前沿AI系统(Claude Code with Claude Opus 4.7、Codex with GPT-5.5、Gemini CLI with Gemini 3.1 Pro)进行了450次符合伦理的实验。结果显示,投毒攻击在49.56%的实验中成功,而检测率仅为6.0%。攻击不需要特定主题的触发词、代理访问、间接提示注入或伪造论文,仅依赖开放数据生态系统和误导性元数据。为缓解攻击,研究者提出了两种措施:科学家角色(scientist persona)和数据来源审计(data provenance audit),后者包括五项检查(参考文献、社交标记、统计异常、相关数据集、投毒警告)。结果表明,科学家角色仍导致16.67%的实验得出被投毒的结论,而数据来源审计将攻击成功率降至零。论文结论指出,间接数据投毒可能以前所未有的规模实现科学欺诈,但通过代理在数据检索过程中的适当审计可以有效缓解。
💡 推荐理由: 本文揭示了一种新型AI安全威胁:通过操控公开数据集,攻击者可远程破坏科学研究的完整性,且检测极为困难。对使用AI辅助研究的机构和个人具有重要警示意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Chongkai Li, Bang Zhang, Wenjian Luo
本文研究了联邦学习(FL)中的一种新型攻击:中央化“取走训练数据”(TATD)攻击。传统的TATD攻击利用深度模型的记忆能力存储并恢复训练数据,但在联邦学习环境中,多客户端平均聚合可能会覆盖编码后的数据,使得攻击难以实现。为此,作者提出了FedCVESA方法,这是相关值编码攻击(CVEA)的联邦变体。该方法假设恶意服务器选择n个目标客户端,通过向目标客户端的损失函数添加皮尔逊相关正则化项,将私有训练数据逐步编码到选定的模型参数(称为载体参数)中。为了减少服务器聚合时载体参数被覆盖,作者进一步提出对分散的载体参数进行分段聚合,保留选定的载体参数,同时对其余参数进行标准平均。在MNIST、Fashion-MNIST和CIFAR-10数据集上,基于狄利克雷非独立同分布划分的实验表明,该方法能够在保持可接受主任务效用的前提下,从训练好的模型中窃取语义上可识别的私有训练图像。这些结果证明,在所研究的白盒恶意服务器设置下,联邦学习可以成为主动TATD攻击的参数级记忆通道。
💡 推荐理由: 揭示了联邦学习在面对恶意服务器时,模型参数可能成为泄露训练数据的通道,对隐私保护构成严重威胁,提醒安全从业者关注联邦学习中的主动攻击风险。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Stefan Bühler, Mark Schutera
该论文研究了针对开源机器人视觉语言动作模型(VLA)的数据投毒攻击,特别是触发词(trigger-word)投毒。作者指出,当前开源机器人生态系统在社区贡献的数据集上存在信任假设,而攻击者可以通过注入少量中毒样本就能隐蔽地嵌入后门,使机器人在接收到特定触发词时失效。论文以smolVLA模型为测试对象,在LeRobot平台的真实拾放(pick-and-place)任务上进行实验,设置了三种中毒比例(1/320、3/320、10/320),并评估了不同触发词位置(前置、中置、后置)的影响。实验结果显示:仅需3个中毒片段(episode)即可实现完全拒绝服务(DoS),所有触发词条件下的成功率降至0.0±0.0%,机器人锁定在固定关节配置,不执行任何任务运动;而在正常提示下,模型保持约50%的成功率,表明攻击具有隐蔽性。即使仅1个中毒片段,成功率也降至6.7±6.7%,机器人虽有运动但无法完成任务。攻击还能泛化到中置和后置触发词位置,尽管训练时仅使用前置触发。该研究证明此威胁是实际可行、低成本且隐蔽的,因此需要将数据集来源的可信性视为开源机器人生态中的首要安全问题。
💡 推荐理由: 首次实践验证对开源机器人VLA模型的数据投毒攻击,证明其低成本、高隐蔽性及严重后果(完全拒绝服务),对机器人安全社区具有重要警示意义。
🎯 建议动作: 研究跟进,关注数据集来源验证和投毒检测技术
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zayd Hammoudeh, Daniel Lowd
本文研究训练集攻击(如数据投毒)的目标识别问题。攻击者通过修改部分训练样本,使模型对特定测试样本产生错误预测。现有防御主要检测中毒样本,但难以定位攻击者试图破坏的具体目标。作者提出基于重归一化影响估计(Renormalized Influence Estimation)的方法,通过修正影响函数在中毒数据下的偏差,准确识别攻击目标。核心思路是计算每个训练样本对目标测试样本的贡献,并利用重归一化消除中毒样本间的相互干扰,从而定位最具恶性影响的训练样本。实验在多个数据集和攻击场景下验证,该方法能高效且高精度地识别攻击目标,优于基线方法。该工作首次将影响函数应用于训练集攻击目标识别,为机器学习安全提供了新视角。
💡 推荐理由: 训练集攻击是机器学习安全的核心威胁,识别攻击目标可帮助防御者快速响应、定位受损资产,提升ML系统的可信与可控性。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Poojitha Thota, Shirin Nilizadeh
该论文针对在微调阶段对大型语言模型(LLM)进行数据投毒攻击的防御问题展开研究。在抽象文本摘要任务中,微调数据集通常较小,攻击者可通过操纵少量训练样本,使模型生成有偏见或有害的摘要,同时保持标准评估指标正常。论文提出了一种统一的防御框架,可在模型部署后检测并修复微调阶段的数据投毒。在白盒场景下,被投毒的文档-摘要对表现出异常高的训练影响,通过影响函数分析和语义一致性检查可有效检测。在黑盒场景下,被投毒模型对保持语义的扰动表现出2-3倍的敏感性,可实现无需访问训练数据的行为审计。此外,论文还引入了两种新型攻击:事实扭曲攻击和代表性偏见攻击,证明投毒可改变摘要行为而不触发常规警报。实验基于9种架构和6个基准数据集,在自适应攻击下,检测精度达到85-92%,梯度上升遗忘(unlearning)可恢复高达96%的原始行为,且ROUGE指标下降小于0.6%。研究表明,微调阶段投毒会留下持久的结构性痕迹,使得无需完全重新训练即可实现实用检测和部署后恢复。
💡 推荐理由: LLM在微调阶段面临的数据投毒风险极具隐蔽性,传统防御难以兼顾效果和效率。本文首次提出统一的后验防御方案,兼顾检测与恢复,对AI供应链安全具有重要参考价值。
🎯 建议动作: 研究跟进,考虑在内部LLM微调流水线中集成类似检测与修复机制
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yibin Hu, Xiaolin Sun, Zizhan Zheng
本文针对基于模型的学习代理(model-based learning agents)中世界模型(world model)的微调阶段面临的数据投毒攻击问题,提出了SWAAP(Stealthy World Model Manipulation via Data Poisoning),这是首个两阶段数据投毒框架。在第一阶段,SWAAP通过一阶双层优化(first-order bilevel optimization)并利用过渡梯度定理(transition-gradient theorem)识别出一个有害的目标世界模型,该模型在保持与干净模型动态相近的同时,诱导规划(planning)产生低回报行为。在第二阶段,SWAAP通过隐身约束梯度匹配(stealth-constrained gradient matching)实现该目标,仅修改有限比例的微调转变目标(transition targets),使得诱导训练梯度将受害者模型推向对抗目标,同时预测误差正则化器(prediction-error regularizer)鼓励投毒目标保持在世界模型自然近似误差的范围内。为了评估攻击的隐蔽性,作者在投毒管线的三个阶段评估了防御和可检测性:训练前检测投毒转变、微调期间的鲁棒训练、以及测试时监控产生的世界模型。在多种连续控制任务中,SWAAP导致显著的性能退化,同时保持投毒转变与干净数据接近,并逃过了所评估的非自适应残差/CUSUM/TRIM风格的防御。这些结果揭示了世界模型适应管道中的一个实际漏洞,并强调了需要保护世界模型训练数据和学到的动态的鲁棒方法。适合安全研究人员、AI系统防御者以及强化学习从业者阅读。
💡 推荐理由: 该研究揭示了基于模型强化学习中世界模型微调管道的训练时攻击面,攻击者可通过少量数据投毒操纵模型导致低回报行为,且现有防御难以检测,对部署安全关键型自主代理构成威胁。
🎯 建议动作: 研究跟进,评估内部基于模型强化学习系统的数据投毒风险,探索鲁棒微调与异常检测方法。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ethan Rathbun, Ahmed Agha, Saaduddin Mahmud, Christopher Amato, Alina Oprea, Eugene Bagdasarian
该论文研究了世界模型(world models)在机器人学习管道中的安全性问题。世界模型作为一种高效的数据生成和仿真工具,正被越来越多地集成到机器人训练流程中,但本文证明了世界模型引入了一种隐蔽且有效的数据投毒攻击入口。与传统的直接向训练数据注入危险轨迹的方法不同,作者提出的新型攻击向看似安全的远程操作数据中注入恶意提示或过渡动态,这些恶意数据只有在通过世界模型处理时才会激活,从而生成合成危险轨迹,最终导致训练出不安全或被篡改的机器人策略。攻击在动作条件世界模型和文本条件世界模型上均得到验证,包括对下游深度强化学习策略的端到端后门攻击,以及视觉-语言-动作(VLA)场景的概念验证。该研究突显了世界模型在机器人学习供应链中的脆弱性,并呼吁开发更安全的模型以及重新评估其集成方式。适合机器人安全、对抗性机器学习和系统安全领域的研究人员阅读。
💡 推荐理由: 世界模型作为新兴组件,此前未被充分认识其安全风险;本文揭露的新型投毒攻击隐蔽性强、后果严重,直接威胁机器人策略的可靠性与安全性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shawn Shan, Arjun Nitin Bhagoji, Haitao Zheng 0001, Ben Y. Zhao
本文提出了一种针对深度神经网络数据投毒攻击的取证溯源工具。在对抗性机器学习领域,新的防御措施常常被更强大的攻击迅速攻破,因此取证工具可以作为现有防御的有益补充,通过追溯成功攻击的根本原因,为未来防范类似攻击提供缓解路径。作者提出了一种新颖的迭代聚类与剪枝解决方案,该方法逐步剔除“无辜”的训练样本,直至剩余样本全部为导致攻击的投毒数据。具体而言,该方法基于训练样本对模型参数的影响进行聚类,然后利用高效的数据遗忘机制剪除无辜簇。作者在计算机视觉和恶意软件分类领域,针对三种脏标签(后门)投毒攻击和三种干净标签投毒攻击进行了实证评估,系统在所有攻击上实现了超过98.4%的精确率和96.8%的召回率。此外,该系统对四种专门设计用于攻击它的反取证措施表现出鲁棒性。该工作为安全从业者提供了一种事后分析工具,可用于定位训练数据中的恶意样本,辅助模型修复和攻击溯源。
💡 推荐理由: 数据投毒攻击是机器学习模型面临的重要威胁,本文提出的取证溯源方法能够有效定位投毒样本,填补了现有防御体系中事后分析的空白,对提升模型供应链安全具有实际价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chamara Sandeepa, Bartlomiej Siniarski, Shen Wang 0006, Madhusanka Liyanage
随着物联网和移动设备中海量数据的快速增长,分布式机器学习技术日益受到关注,联邦学习(FL)作为一种保护隐私的分布式学习框架,允许多方协作训练模型而无需共享原始数据。然而,FL容易受到数据投毒攻击,恶意客户端可能通过操控本地数据或模型更新来破坏全局模型。现有防御方案多基于相似度度量或异常过滤,但缺乏对攻击者意图的深度分析,且无法提供可解释的证据来判定恶意客户端。针对这一问题,本文提出了SHERPA,一种利用Shapley加法解释(SHAP)来识别FL系统中潜在投毒者的鲁棒算法。SHERPA的核心创新在于:首先,通过SHAP值计算每个客户端对全局模型的特征贡献;然后,基于特征归因聚类开发一种新的算法来区分投毒者和正常客户端。在多个数据集上模拟了不同场景的数据投毒攻击(包括针对隐私的投毒攻击),实验表明SHERPA能够有效缓解攻击,同时提供可解释性,为聚合过程中剔除恶意客户端提供合理的依据。该方法不仅提升了防御的可解释性,还增强了对投毒行为判定的合理性。本文的研究展示了可解释人工智能(XAI)技术在联邦学习安全防御中的潜力,为后验特征归因在对抗数据投毒攻击中的应用提供了新的视角。
💡 推荐理由: 联邦学习的安全性是当前AI隐私计算中的关键挑战。SHERPA提供了可解释的鲁棒防御机制,能帮助安全团队理解为何将某客户端标记为恶意,从而提升联邦学习系统的透明度和可信度。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jack Sanderson, Yihan Wang, Xiaoqian Lu, Gautam Kamath, Yiwei Lu
本文研究了大语言模型(LLM)后训练阶段中的顺序数据投毒威胁。LLM后训练通常包括多个阶段,如监督微调(SFT)和基于人类反馈的强化学习(RLHF)或直接偏好优化(DPO),每个阶段的数据来自不同、可能不可信的来源。现有文献假设每个训练阶段可能发生单次数据投毒攻击,但忽略了多个攻击者协同攻击的可能性。为此,本文提出了“顺序数据投毒”威胁模型,其中多个敌手分别污染SFT数据集和偏好数据集。在该模型下,作者发现了“单攻击者错觉”:单独评估每个敌手时,威胁看似微不足道;但当敌手跨阶段协作时,真正的脆弱性暴露无遗。在SFT→DPO管道中,攻击者的贡献是累加性的:将固定投毒预算分散到多个阶段比集中在单一阶段效果更显著。在SFT→PPO管道中,攻击者的贡献是互补的:单独进行SFT投毒或奖励模型投毒均无法成功,但两者结合却能奏效。这些发现表明,对单个后训练阶段的安全性分析会系统性低估仅由阶段间交互产生的复合漏洞。代码已开源。本文适合AI安全研究员、LLM训练流程设计者及防御方关注,以理解多阶段攻击的潜在风险和评估现有防御的不足。
💡 推荐理由: 揭示了LLM后训练中多阶段联合投毒的复合风险,提醒安全从业者孤立评估每个阶段的威胁是不够的。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jiachen Qian
检索增强生成(RAG)通过引入外部知识库来缓解大语言模型的幻觉问题,但同时也引入了语料库完整性的新攻击面。本文提出 SilentRetrieval,一种两阶段数据投毒攻击,能够在不破坏文档流畅性的前提下劫持 RAG 系统。第一阶段使用协调束搜索(Coordinated Beam Search),这是一种结合流畅性-相似性目标的多 token 联合优化方法,使被污染的宿主文档在保持低困惑度的同时仍然可检索。第二阶段使用上下文自适应触发器生成(Context-Adaptive Trigger Generation),利用冻结的 LLM 驱动轻量级触发器融合步骤,将操纵触发器嵌入文档内容。在单毒化文档每查询的评估设置下,使用合成目标答案,SilentRetrieval 在 Natural Questions 和 MS MARCO 数据集上分别实现了 84.6%/81.3% 的 HR@10 和 57.5%/54.8% 的 ASR-LLM,同时保持接近良性文档的困惑度。跨模型评估显示,在固定触发器生成器下对四种目标 LLM 仍有非平凡效果;针对包括 ColBERT 和商业嵌入模型在内的未见检索器的迁移测试,在相同注入语料协议下平均 HR@10 为 64.7%。在采样维基百科规模评估中,以 0.016% 的投毒比例仍保持 74.2% 的 HR@10。结合检索侧和生成侧的防御虽然显著降低了攻击成功率,但引入了延迟权衡。人工评估显示,与不流畅的基线相比,标记率更低,但在当前样本量下仍比良性内容数值上更可疑。该研究揭示了 RAG 系统在面对精心构造的对抗性文档时的脆弱性,并提示需要更鲁棒的防御机制。
💡 推荐理由: RAG 系统被广泛用于减少 LLM 幻觉,但本文展示了一种隐蔽的数据投毒攻击,能够以极低投毒比例劫持检索结果,影响输出安全性。对于构建 RAG 应用的安全团队,该研究揭示了现有防御的不足,需关注语料库完整性保护。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zedian Shao, Charles Fleming, Teodora Baluta
大型语言模型(LLM)通常使用未经过滤的文本数据集进行微调,而对手可以污染这些数据集。现有的数据投毒攻击主要依赖于固定的触发短语,这些短语可以被异常检测、干净数据正则化或在线监控等防御手段中和。本文提出了一种新的数据投毒方法,通过共享知识(如事实或概念)与攻击者选择的短语之间的语义关联,使LLM学习一种可靠且隐蔽的信息隐藏方案。这种隐藏方案可以编码和解码任意恶意指令,从而揭示了一种新的、微妙的投毒诱导漏洞:隐蔽控制攻击。作者精确刻画了隐蔽控制攻击的特征,并在5个LLM、3种后门防御和4种提示注入防御上进行了评估。在较小的污染比例下,相比干净的微调模型,隐蔽控制攻击在平均攻击成功率上比基于启发式的提示注入攻击相对提高了约40%。它们还能规避基于检测和微调的防御,在后门防御后保持高达93%的攻击成功率,在提示注入防御后保持高达98%的攻击成功率。这项研究展示了LLM微调过程中一种新型的、难以防御的威胁,对LLM的安全部署提出了严峻挑战。
💡 推荐理由: 该攻击通过语义关联隐藏指令,能绕过现有检测和防御机制,对LLM安全构成新威胁,安全从业者需关注此类隐蔽后门攻击的演变。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mahshid Rezakhani, Nowfel Mashnoor, Kimia Azar, Hadi Kamali
随着大语言模型(LLM)越来越多地被微调用于硬件任务(如寄存器传输级(RTL)代码生成),高质量数据集的稀缺性常常导致使用快速组装或生成的数据。这些数据集缺乏安全验证,极易受到数据投毒攻击,使得模型生成语法正确但存在安全漏洞的硬件模块,绕过标准功能检查。为此,本文提出SafeTune框架,旨在增强基于LLM的RTL代码生成对投毒攻击的鲁棒性,特别关注硬件木马(HT)插入。SafeTune包含两个核心组件:(1)图神经网络(GNN),通过建模结构属性在微调过程中识别异常电路模式;(2)语义验证模块,利用文本嵌入和XGBoost分类器评估提示词的安全性。通过结合结构知识和语义知识,SafeTune有效过滤投毒输入而不牺牲合法数据。实验结果表明,SafeTune在无需修改底层模型架构的情况下,显著提升了LLM微调的鲁棒性和可靠性。
💡 推荐理由: 硬件安全中RTL生成是新兴方向,数据投毒攻击可导致芯片级别后门,SafeTune提供了实际可用的防御框架。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)