👥 作者: Suresh Tamang
该论文研究医疗影像诊断模型中的后门(训练期投毒)检测问题。作者指出,医疗行业指南已把模型投毒与对抗攻击列为需要专门防御的行业级威胁,联邦政策也要求把 AI 漏洞检测工具扩展到农村医院等关键基础设施运营方,因此面向医疗影像流水线的后门检测具有明确的合规与安全背景。目前社区中最常用的两类后门检测方法——频谱特征分析(spectral signature,基于类内表征的频域异常排序)与激活聚类(activation clustering,基于中毒样本在中间层激活空间中的聚类离群性)——通常被当作相互独立的基线分别评估,两者输出很少被结合;同时,在医学影像基准上的检测性能报告也远少于自然图像领域。本文的贡献有三点:第一,提出一个分数级融合规则,把逐类别的频谱排序得分与激活聚类标志位合成为单一逐样本投毒评分,并给出模型级一致性统计量;第二,开源实现该融合方案对应的八阶段检测流水线;第三,在一个公开医学影像基准的合成投毒变体以及 CIFAR-10 上,以 0%、1%、5%、10% 四档投毒率、每档五个随机种子进行评测,对比单独检测器与融合检测器的表现。结果显示:在医学影像基准上,融合检测器在所有非零投毒率下均达到 AUROC ≥ 0.99,说明融合在医疗影像场景下显著有效;但在 CIFAR-10 上融合并不一致地带来增益——10% 投毒率时激活聚类的真阳性率降至 0.000,频谱方法的 AUROC 也退化到接近随机(0.545),而此时攻击成功率仍高达 97.2%,表明后门已完全植入却未被检出,融合分数由于是两类信号的加权组合,也继承了这一联合失效。论文最后把检测输出映射到 NIST AI RMF 的 Measure 功能与 MITRE ATLAS 术语体系,使结论可以直接用安全与合规团队熟悉的语言表达。
💡 推荐理由: 医疗影像 AI 的后门检测长期缺乏公开基准与可复现工具。本文既给出开源八阶段流水线与融合评分方法,又诚实地暴露了方法在自然图像高投毒率下的联合失效(AUROC 退化至 0.545、攻击成功率 97.2%),对评估自身检测能力边界很有参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rui Wen, Ahmed Salem, Andrew Paverd, Mark Russinovich, Zheng Li
该论文关注大语言模型供应链中的后门风险:模型常被第三方微调、共享或直接下载,因此实际部署的模型可能在良性输入下表现完全正常,一旦出现攻击者预设的秘密触发器,就切换为攻击者控制的行为。部署前的静态审计虽然有效,但对于持续更新、频繁重新微调或热替换权重的模型,运行时监控仍然必不可少。然而 LLM 推理服务对延迟极其敏感,已有的推理时后门检测器存在两类局限:一是依赖对触发器形式的先验假设(例如假设触发器是固定短串或特定 token),面对隐蔽、自适应设计的攻击容易失效;二是需要在推理路径上引入额外的模型计算,例如对输入做扰动、多次前向或额外执行一遍生成,带来明显的吞吐与延迟代价。
作者提出 SpecGuard,一个推理时后门检测器,其核心思路是复用投机解码(speculative decoding)这一常见的推理加速机制,从而在不增加任何额外模型计算成本的前提下获得检测能力。投机解码的工作方式是:由一个小型草稿模型一次性提议多个候选 token,再由目标模型并行验证并决定是否接受,以加快生成。论文观察到,这个验证过程本身就隐含了一个有价值的安全信号:当后门被触发时,目标模型的行为会向攻击者期望的方向偏移,而干净的草稿模型并不会预测出这种偏移,因此草稿 token 的接受率会出现可观测的变化(相对良性输入下的基线发生偏离)。作者进一步形式化刻画了该信号在什么条件下会出现,并给出分析表明:攻击者若想刻意压制这一信号,就必须同时削弱后门本身的效力,即检测能力与后门强度之间存在内在权衡。
实验上,作者在多种后门类型与多个模型家族上评估 SpecGuard,结果显示它能够可靠地检测出被触发的后门行为,其中包括那些输入层过滤手段完全失效的隐蔽攻击情形;同时它不需要像现有运行时检测器那样付出额外的生成开销。论文由此得出结论:投机解码除了加速推理之外,还可以同时充当一个免费、常开(always-on)的检测信号,用于发现被植入后门的 LLM 行为。
💡 推荐理由: 第三方微调与频繁更新的模型很难仅靠上线前审计覆盖,而运行时检测普遍受制于延迟成本。该工作提示一种零额外推理开销、可常开的后门监控信号,并与输入层过滤形成互补,适合推理服务与模型托管方纳入评估。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Wanlun Ma, Derui Wang, Ruoxi Sun 0001, Minhui Xue 0001, Sheng Wen, Yang Xiang 0001
本次输入仅提供论文标题与作者信息,未包含论文摘要内容。根据标题推测,该论文提出了一种名为'Beatrix'的后门检测方法,核心是利用Gram矩阵分析深度学习模型的内部特征,以实现对模型后门的鲁棒检测。后门攻击是深度学习模型面临的重要安全威胁,攻击者在训练阶段注入恶意行为,使模型在特定触发条件下产生错误输出,而现有检测方法往往在鲁棒性或适用性上存在不足。Gram矩阵通常用于捕获特征之间的二阶统计相关性,可能有助于揭示后门植入引起的特征分布异常。然而,由于缺乏abstract,我们无法提供具体的技术细节(如网络层选择、检测阈值设定、攻击场景假设)、实验设计(如使用的数据集、模型架构、基线方法)以及性能评估结果。因此,以上描述均为基于标题的合理推测,实际内容请以论文原文为准。安全从业者可关注该方法是否能为模型安全审计提供新的思路,但需阅读原文验证其有效性与适用性。
💡 推荐理由: 后门攻击严重威胁深度学习模型的可信度,鲁棒的检测方法是防御体系的重要一环。该方法若有效,可提升安全人员对模型后门的发现能力。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Md. Nahid Hasan, Mohammad Arif Hossain
本研究针对开源权重微调大语言模型(LLM)中后门注入的检测问题进行实证分析。在模型分享平台上,任何人都可以上传自称安全的微调模型,但模型可能内置后门:在普通输入下表现正常,一旦遇到特定触发器则产生恶意行为。对于完全不掌握训练数据、原始干净权重或触发器信息的用户来说,在投入使用前很难验证模型安全性。为此,作者提出了一种黑盒测试方法“自反馈”(self-feeding),其核心思想是将模型自身的输出作为下一次输入喂回给模型,使生成文本逐步偏离初始提示,向微调时使用的数据分布漂移,从而在不依赖任何内部信息的情况下诱发后门触发。作者在6个开源权重LLM(参数量从3B到15B)上开展了实验,这些模型分别被注入了覆盖11类攻击类别(如恶意指令、有害内容等)的后门。使用20个普通起始提示,每个提示最多生成10步链,并与重复同一提示的基线方法进行对比。实验结果显示:自反馈方法在6个模型中的5个成功检测到后门,池化精确率达到92.0%,而基线仅在120个提示-模型组合中的1个上成功;从笑话请求、算术问题或咖啡配方开始的链可以在几步内触发后门。尽管单次提示的召回率较低(19.2%),但结合多个起始提示后,模型级检测率显著提升。研究也指出了方法的不足:1个模型从未被触发,且自反馈产生了2个基线无法产生的误报。进一步优化发现,将链长度缩短至4步,可在保持100%模型级检测精度的同时减少60%的查询。该方法仅需文本级查询接口和识别恶意输出的能力,为下载模型后的廉价快速初筛提供了可行方案。适合LLM安全研究人员、模型评估人员和蓝队成员阅读。
💡 推荐理由: 为黑盒场景下检测微调LLM后门提供了低成本、无需先验知识的可行方法,有助于缓解开源模型供应链风险,值得所有下载和使用微调模型的开发团队关注。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Chong Fu 0002, Xuhong Zhang 0002, Shouling Ji, Ting Wang 0006, Peng Lin, Yanghe Feng, Jianwei Yin
本文针对深度神经网络中的木马(后门)攻击检测问题提出了一种新的无数据方法 FreeEagle。后门攻击是一种典型的人工智能威胁,被植入木马的模型在遇到带触发器的输入时会产生攻击者指定的异常行为,而在干净输入下表现正常。现有的后门检测方法大多依赖防御者能够获得一批干净验证样本或带有触发器的样本,但这一假设在真实世界中可能不成立,例如模型共享平台的维护者只能获得模型本身而无法获得训练数据或触发样本。为此,作者首次提出了无需依赖任何干净样本或带触发样本的 FreeEagle 方法,实现了对复杂后门攻击的有效检测。该方法通过分析模型内部表征和决策边界的异常特征,在数据不可见的情况下识别后门植入的痕迹。在多种数据集和模型架构上的评估结果表明,FreeEagle 对各类复杂后门攻击均有效,甚至在部分场景下优于现有的非无数据后门检测方法。该研究的核心贡献在于突破了传统检测方法对验证数据的依赖,为模型供应链安全提供了新的技术路径,尤其适用于模型共享、第三方模型审核等场景。本文适合研究深度学习安全、模型后门检测以及AI供应链安全的从业者和学者阅读。
💡 推荐理由: 模型共享平台和第三方模型审核往往无法获得训练数据或触发样本,FreeEagle 提供了无需任何样本的后门检测能力,极大提升了实际防御场景的可行性,对AI供应链安全具有重要意义。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiming Chen, Kemou Li, Haiwei Wu, Jiantao Zhou
本文针对多模态对比学习(MCL)中的后门攻击检测问题展开研究。MCL 模型(如 CLIP)被广泛用于预训练,但其容易受到后门攻击的影响,现有基于检测的防御手段主要依赖 CLIPScore 指标,假设中毒图像-文本对具有较低的语义相似度。然而,作者指出现有方法存在两个关键缺陷:一是良性对与中毒对的 CLIPScore 分布存在显著重叠,使得该指标难以可靠区分;二是固定阈值检测无法对重叠区域中的模糊样本提供统计保证。为克服上述局限,本文引入保形预测(Conformal Prediction, CP)这一统计框架,利用非一致性分数(Nonconformity Scores, NCSs)量化不确定性,从而为检测中毒图像-文本对建立具有可证明置信界的方法。在此基础上,作者提出 CASCADE——一种新型的两阶段粗到细的保形后门检测框架。在粗粒度阶段,通过跨模态一致性筛选出高置信度的良性对和中毒对;在细粒度阶段,利用高置信度中毒对构建参考集,并针对未识别子集中的每个样本计算基于文本空间相似度的实例级 NCS,以度量其与中毒分布的符合程度,进而精确识别潜在中毒对。在 CC3M 大规模数据集上的大量实验表明,CASCADE 在多种攻击场景下平均可实现 100% 真阳性率(TPR)时仅 5.79% 的假阳性率(FPR),平均 AUROC 达到 0.9867,并且对自适应攻击仍保持有效性。该工作为多模态对比学习模型提供了一种兼具统计保证与高检测精度的后门防御新思路。
💡 推荐理由: 多模态预训练模型已被广泛采用,后门攻击威胁真实存在。现有 CLIPScore 检测法有统计缺陷,CASCADE 通过保形预测提供可证明的置信界,提升了检测可靠性,值得安全从业者关注。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu
本文研究多智能体LLM系统中分布式后门攻击的早期检测问题。攻击者通过一个中毒工具将加密后的恶意负载片段隐藏在观测结果中,这些片段被分发到多个智能体,运行结束后由外部过程重组并执行。由于每个智能体单独持有片段不完整,逐步骤的安全检查可能无法识别完整的分布式负载。作者构建了一个层次化多智能体系统的工作实例,在五个语言模型和两个任务领域下运行良性场景和受攻击场景,记录每个片段注入的时间以及负载组装和执行的时间。检测本质上是与负载组装速度的竞赛:在第一个片段注入之前,攻击与良性运行无法区分;一旦注入开始,一个基于前缀的检测器能够以中位数剩余5步的时间检测出99.3%的成功攻击,同时良性运行的假阳性率为10.3%。由于负载的组装发生在运行结束后,这些警报足以提前中止几乎每一次成功攻击。进一步分析表明,检测能力很大程度上依赖于可移除的攻击表面线索,主要是密文的长度和熵特征。当去除这些线索后,检测延迟增加且跨领域迁移性变差,但经过微调的模型可恢复部分损失。该研究揭示了分布式后门攻击的独特检测挑战,并强调了基于结构特征而非表面线索的鲁棒检测方法的必要性。
💡 推荐理由: 多智能体LLM系统面临新的分布式后门威胁,传统逐步骤安全检测失效。本文首次系统研究此类攻击的早期检测可行性,揭示检测窗口和依赖的表面线索,对设计安全的多智能体协作架构有重要指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hanlei Zhang, Yijie Bai, Yanjiao Chen, Zhongming Ma, Wenyuan Xu 0001
本文提出了一种名为BARBIE的鲁棒后门检测方法,旨在解决深度学习模型共享中的安全风险。后门攻击会使模型在正常样本上表现正常,但在含有特定触发器的样本上产生恶意行为。现有检测方法利用良性模型与后门模型在潜在表示上的可分离性(latent separability),通过聚类或距离度量来区分,但这些方法容易被自适应攻击(adaptive attacks)绕过。BARBIE提出了一种新的度量指标——相对竞争分数(Relative Competition Score, RCS),通过刻画潜在表示对模型输出的主导性来表征可分离性,该指标对各种后门攻击具有鲁棒性,且难以被攻击者操控。该方法无需访问任何良性或后门样本,仅通过反转每个标签的两组潜在表示(一组反映良性模型的正常表示,另一组放大后门模型的异常表示)来计算RCS。基于RCS,BARBIE构建了一系列指标来全面反映后门模型与良性模型的差异。实验在4个数据集上对超过10,000个模型进行了验证,覆盖14种后门攻击类型,包括针对潜在可分离性的自适应攻击。与7种基线方法相比,BARBIE在源不可知攻击(source-agnostic)上平均真阳性率提升17.05%,源特定攻击提升27.72%,样本特定攻击提升43.17%,干净标签攻击提升11.48%,同时保持更低的假阳性率。该研究为模型供应链安全提供了有效的防御工具。
💡 推荐理由: 后门攻击威胁深度学习模型共享生态,现有检测方法易被自适应攻击绕过。BARBIE通过新颖的RCS度量实现鲁棒检测,显著提升真阳性率并降低误报,为安全部署模型提供了可靠手段。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Haodong Zhao, Tianyi Xu, Tianhang Zhao, Zhuosheng Zhang, Gongshen Liu
该论文提出了一种名为GradSentry的后门样本过滤方法,用于防御大语言模型(LLM)微调过程中的后门攻击。研究背景是:在微调LLM时,使用不可信的数据集可能引入后门攻击,其中被投毒的样本会导致模型在特定触发器下产生恶意行为。现有的样本过滤防御方法通常依赖于聚类技术,但这需要足够的数据量,并且在极端投毒比例下可能失效。GradSentry的核心思想是利用每个样本梯度的谱熵来区分干净样本和投毒样本。关键发现是,与干净样本相比,投毒样本产生的梯度具有更高的谱熵。该方法通过计算每个样本的梯度谱(即梯度的奇异值分布)来捕捉改变模型输出的后门签名,从而避免在特征构建过程中进行样本对比较或聚类。GradSentry是训练无关的:它既适用于参数高效微调方法(如LoRA),也适用于全参数微调,因为梯度分析独立于训练过程中更新的参数。该方法不需要聚类,在所有投毒比例(1%到90%)下均能有效运作,并且计算开销很小(对于7B模型,每个样本仅需20-50毫秒)。在四个问答数据集和四种攻击类型上的评估表明,谱熵对于后门检测是有效的。代码已开源。
💡 推荐理由: 针对LLM微调中的后门攻击,现有聚类方法在高或极低投毒比例下失效,GradSentry利用梯度谱熵提供了一种轻量、高效且无需聚类的替代方案,为LLM安全微调提供了新的防御思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yinbo Yu, Xueyu Yin, Jing Fang, Chunwei Tian, Qi Zhu, Jiajia Liu, Daoqiang Zhang
深度神经网络(DNN)仍然容易受到后门攻击,现有后门检测方法通常需要干净数据、代理数据、梯度或迭代触发器重建,导致计算成本高且在实际模型审计场景中鲁棒性有限。本文提出HTell,一种快速、轻量级且无需数据的后门检测方法,基于头部随机探针技术。HTell的核心洞察是:后门模型在随机潜在探针下,预测头部的目标类别上往往表现出异常高的响应集中度。该方法首先生成架构感知的随机潜在探针,直接馈入模型头部,然后通过分析类别级响应统计量来检测后门,无需访问真实/代理数据、模型梯度或参数优化。在包含超过6000个后门模型和700多个干净模型的大规模基准上进行评估,覆盖4个数据集、14种架构和21种后门攻击类型。HTell实现了99.03%的真阳性率和2.11%的假阳性率,每模型检测延迟仅为12.69毫秒,相比基于梯度的代表性检测器时间成本降低超过30,000倍。结果表明,头部随机探针为大规模无数据后门模型审计提供了准确、鲁棒且高效的解决方案。
💡 推荐理由: HTell实现了无需数据、快速且高精度的后门检测,大幅降低了模型审计的计算门槛,适合安全团队在本地或云端大规模部署前对第三方模型进行黑盒筛查。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yinbo Yu, Jing Fang, Xuewen Zhang, Chunwei Tian, Qi Zhu, Daoqiang Zhang, Jiajia Liu
本文针对深度神经网络(DNN)的后门攻击检测问题,提出了一种轻量级、快速的静态参数检测框架DFBScanner。现有防御方法通常依赖激活异常分析或触发器逆向工程,往往需要干净样本或先验知识,导致效率低、实用性差、泛化能力不足。尤其严重的是,虽然先进的后门攻击可以在毫秒级完成注入,但现有检测方法通常需要数分钟甚至数小时。DFBScanner基于一个关键观察:后门引起的特征扰动会导致最终分类层中出现独特且异常的参数更新。因此,该方法将检测焦点从识别多样且攻击特定的触发器模式,转移到识别最终层中统一的后门表现,从而实现高效且攻击无关的检测。具体地,通过构建并策略性地组合最终层参数的多个异常指标到一个特洛伊线索中,DFBScanner通过最大异常评分来检测后门。该方法在大规模后门基准上进行了评估,包括超过5000个后门模型,涵盖4个数据集、12种网络架构、20种后门触发器类型、2种攻击策略(all-to-one和all-to-all)以及3种后门注入方法(数据投毒、训练流程操纵和比特翻转)。数值结果表明,DFBScanner实现了97.17%的真正率、0.95%的假正率,且每个模型的平均检测时间仅为1毫秒,显著优于先前方法。该研究适合安全研究人员、AI系统防御工程师以及对模型后门检测感兴趣的从业者阅读。
💡 推荐理由: 提出了一种毫秒级、高精度的后门模型检测方法,解决了现有方法效率低、依赖先验知识的痛点,可直接用于AI模型供应链安全的快速筛查。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Pengyu Chen, Weiyang Li, Jin Xu, Jiacheng Wang, Ning Wang, Dusit Niyato, Tao Xiang
本文探讨了人工智能原生无线网络中模型取证的技术框架、应用场景及案例分析。随着AI深度嵌入无线网络,模型成为影响信号处理、资源调度和网络控制的核心组件,但模型异常、篡改和恶意功能也引入了新的安全风险。作者首先梳理了模型取证的关键问题,包括模型真实性验证、恶意功能识别和问责溯源,并归纳了模型取证的主要类别。接着,阐述了模型取证在AI原生无线网络中的作用,并回顾了代表性应用场景。在案例研究中,以射频指纹识别为例,提出了基于水印认证和后门检测的两条具体工作流程,展示了如何在实践中实现来源认证和恶意行为识别。结果表明,模型取证能为AI原生无线网络中的异常评估、来源追踪和可信运行提供重要支持。最后,作者指出了这一新兴领域未来研究的若干有前景的方向。本文适合无线网络安全、AI安全及模型可解释性领域的研究者和工程师阅读。
💡 推荐理由: 随着AI原生无线网络的部署,模型安全问题日益突出。本文首次系统性地提出模型取证框架,有助于提升网络对模型攻击的检测与溯源能力,对保障未来无线通信基础设施的安全具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nay Myat Min, Long H. Pham, Jun Sun
大型语言模型在运行时可能表现出各种异常行为,例如训练时注入的后门在触发词下被激活、越狱攻击绕过安全对齐、提示注入覆盖部署者指令。现有的运行时防御通常针对单一威胁,且依赖干净参考模型、触发知识或可编辑权重,这些假设对不透明的第三方模型往往不成立。本文提出层间收敛指纹(Layerwise Convergence Fingerprinting, LCF),一种无需调优的运行时监控方法。LCF将模型的层间隐藏状态轨迹视为健康信号:对每一层间的差异计算对角马氏距离,通过Ledoit-Wolf收缩聚合,并在200个干净样本上使用留一法校准阈值,无需参考模型、触发知识或重新训练。在四个架构(Llama-3-8B、Qwen2.5-7B、Gemma-2-9B、Qwen2.5-14B)上针对后门、越狱和提示注入三类威胁进行评估(56种后门组合、3种越狱技术、BIPIA邮件和代码问答任务),LCF将Qwen2.5-7B和Gemma-2的平均后门攻击成功率降至1%以下,Qwen2.5-14B降至1.3%;检测92-100%的DAN越狱(GCG和角色扮演为62-100%);在所有(模型、领域)的8个单元格中100%标记文本载荷注入;后门误报率12-16%,推理开销小于0.1%。单个聚合分数即可覆盖全部三类威胁,无需针对具体威胁进行调整,使LCF成为云服务和设备端LLM的通用运行时安全层。
💡 推荐理由: 提供一种无需修改模型、轻量级的运行时异常检测方法,可同时防御后门、越狱和提示注入,适合保护部署在黑盒或第三方LLM中的应用。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)