👥 作者: Zihan Wang, Boheng Li, Rui Zhang, Wenshu Fan, Qingchuan Zhao, Tianwei Zhang, Hongwei Li, Guowen Xu
该论文关注扩散式文生图(Text-to-Image, T2I)服务面临的知识产权风险:攻击者可以仅通过黑盒 API 查询,批量收集"提示词—生成图像"配对数据,再据此训练一个未经授权的替代(学生)模型,从而复刻原服务的生成能力。现有防御主要依赖逐样本扰动优化(sample-wise perturbation),即在每张生成图上在线求解扰动,使这些图像作为训练数据时会"毒化"替代模型的训练过程。但这类方法需要对每个查询实时做最优化,计算开销与延迟都很高,难以用于在线 T2I 服务。作者提出把防御扰动直接内嵌到 VAE 解码器中,让受保护模型在一次前向过程中直接输出带防御效果的图像,从而消除在线逐样本优化。然而实验发现,逐样本目标函数难以迁移到共享解码器场景:共享解码器导致的潜空间偏移(latent shift)远小于逐样本优化,说明在该场景下"目标可达性(reachability)"比"破坏强度"更关键。为此作者提出 RAPID——一种自参照潜空间最大化框架(self-referenced latent maximization):它去掉对外部信号/参考的依赖,让同一次模型更新对各类训练样本都产生一致的破坏性效果,从而提升目标可达性;同时引入重建引导的颜色正则化(reconstruction-guided color regularization),封堵潜空间捷径(latent shortcut)并强化视觉层面的破坏效果。在四个 T2I 模型、四个数据集上,与五个代表性基线对比,RAPID 能持续降低替代模型的生成质量,同时保持服务本身输出图像的视觉保真度。论文定位为面向已部署 T2I 系统的实时反蒸馏防护范式。
💡 推荐理由: 模型蒸馏窃取是 T2I 服务最现实的知识产权威胁之一,而现有逐样本扰动防御因延迟过高难以落地。RAPID 把防御内嵌到 VAE 解码器、实现单次前向的实时保护,为在线 API 服务提供了可部署的防护思路,值得模型服务方与模型水印/防窃取方向研究者跟踪。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaoyan Li, Yunli Wang
本文针对工具集成型LLM智能体面临的对抗攻击问题,提出了通用防御框架。此类智能体通过调用外部工具完成多步任务,但易受直接/间接提示注入、记忆投毒和后门攻击。作者在统一框架下探索了跨四种攻击类型的可泛化防御策略,包括两种基于工具的通用防御:攻击者工具过滤(利用孤立森林等异常检测识别并移除可疑工具)和正常工具召回(白盒方法,在规划前恢复智能体原始工具集);以及基于提示的防御:思维链提示、自我反思和任务复述。实验在四个开源模型(Gemma2-9B、Qwen2-7B、LLaMA3-8B、LLaMA3.1-8B)和三个闭源模型(GPT-3.5、GPT-4、GPT-5)上进行,结果表明这些方法显著降低攻击成功率(ASR),在许多设置下达到0% ASR,同时保持甚至提升原始任务成功率。该工作强调了简单、模块化、多层防御对增强工具集成LLM智能体安全性和鲁棒性的前景,代码已开源。
💡 推荐理由: 工具集成LLM智能体正被广泛部署,其安全漏洞可能导致任务被劫持或数据泄露。本文提出的模块化防御组合可跨多种攻击类型生效,且不牺牲任务性能,为安全团队提供了可落地的加固思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xingyu Lyu, Jiayimei Wang, Jianfeng He, Ning Wang, Yidan Hu, Yimin Chen
检索增强生成(RAG)通过在生成阶段引入外部知识库的检索结果,显著降低了大型语言模型的幻觉与事实性错误,已成为提升 LLM 输出质量的主流范式。然而近期研究揭示了一个关键隐私漏洞:攻击者可构造特定查询,借助检索环节从底层语料库中提取个人可识别信息(PII)。RAG-CT 针对该威胁提出一种轻量级防御方案,其核心思路是不改动底层 LLM 与检索器,而是对进入系统的查询进行统计特征分析——考察查询在熵(entropy)与间隔(margin)维度上的分布差异,并采用基于分数的检测方法(score-based detection)判定其是否为恶意查询。换言之,该方法将“隐私窃取型查询”视为一类可被统计指纹识别的异常输入,通过在生成前进行拦截来阻断 PII 泄漏链路。作者在两个数据集上,使用四种当前先进的攻击策略与四种防御基线开展详尽对比实验,结果表明 RAG-CT 在显著降低 PII 泄漏量的同时,整体表现优于现有防御方案。论文定位为一种无需修改模型权重、无需改动检索组件的即插即用式防护机制,部署成本低,适合在既有 RAG 服务上快速叠加。整体而言,该工作从输入侧统计检测的角度补充了 RAG 安全防护思路,与输出侧过滤、检索结果审查等方案形成互补。
💡 推荐理由: 企业 RAG 知识库普遍包含客户资料、工单、人事文档等 PII,检索环节是已被证实的泄漏通道。该方案不改模型、不改检索器即可部署,属于低成本可落地的输入侧防护,值得纳入 RAG 安全评估基线。
🎯 建议动作: 研究跟进:优先复现其检测思路,评估在本组织 RAG 语料与查询分布下的误报/漏报表现,再决定是否试点部署
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Bingzheng Wang, Xiaoyan Gu, Wentao Wang, Xingyou Yang, Hongcheng Li, Rong Yin
该论文关注 LLM Agent 在调用外部工具时面临的间接提示注入(Indirect Prompt Injection, IPI)风险:由于 Agent 需要读取网页、文件、API 返回等外部内容,攻击者可将恶意指令埋入这些工具输出中,诱导 Agent 执行非预期动作。作者指出,现有防御思路各有局限:提示加固(prompt hardening)容易被自适应攻击绕过;内容过滤往往会过度清洗外部内容,破坏正常任务所需信息;预生成计划难以应对动态、复杂的多步任务;权限约束则牺牲了执行灵活性。因此核心难题是:如何在不限制 Agent 正常规划自由度的前提下,精准定位并仅移除真正诱发不安全动作的那部分恶意内容,从而兼顾安全性与任务效用(security-utility trade-off)。为此作者提出 ActGuard,一个“执行前动作审计”框架。其关键设计是不再判断外部内容本身是否可疑,而是判断该内容是否使当前动作偏离“局部合理预期”。具体而言:在每一步,ActGuard 先预测即将执行的动作可能调用的工具集合,构建一个“局部工具先验(local tool prior)”,该先验不约束实际执行轨迹;随后在执行前将候选动作与该先验进行比对,开展工具级别的对比分析(tool-level contrastive analysis)与参数级别的证据定位(parameter-level evidence localization),以识别工具选择和动作参数上的偏离;最后由一个验证器(verifier)审查被定位到的证据,只对确认恶意的文本片段进行掩码,并基于净化后的上下文重新生成动作。这种“先审计、再最小化清洗、后重生成”的流程既保留了合法的规划灵活性,又避免了无差别过滤带来的信息损失。作者在面向工具使用型 Agent 的挑战性基准上进行了评估,结果显示 ActGuard 能将攻击成功率降至与当前最先进防御相当的水平,同时使任务效用接近无攻击场景,取得了较好的安全—效用平衡。代码已公开于 GitHub 仓库 binzhwang/ActGuard。该工作属于防御方法类研究,适合关注 Agent 安全、提示注入防护与 LLM 系统鲁棒性的研究者和安全工程师阅读。
💡 推荐理由: Agent 通过工具读取外部内容已成为 IPI 的主要入口,而现有过滤/加固方案普遍存在“要么被绕过、要么过度清洗伤效用”的两难。ActGuard 提出的执行前动作偏离审计与最小化证据掩码思路,为企业级 Agent 部署提供了可参考的安全—效用平衡范式。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Guangjie Liu, Guang Cheng, Weiwei Liu
加密流量虽能保护内容,但仍会泄露通信模式,攻击者可据此进行网站指纹等侧信道识别。此前二元情形下的侧信道存在性定理仅能证明两分类间有互信息,无法推广到多分类,也未纳入主动防御(如流量整形)。本文将定理扩展到 k 类场景:利用每类分解 I(X;Y)=∑π_i D_{KL}(P_{Y|i}||P_Y),将互信息表示为各类先验加权的 KL 散度之和;用每类 Wasserstein-1 距离约束防御导致的分布偏移,建模防御成本。三个核心结果:(1) 对所有活动类的互信息求和下界;(2) 级联临界成本定理及每类预算推论,在统一预算下界消失时依然非零;(3) 精度推论 Acc*≥2^{I_0}/k>1/k。在 95 类网站指纹数据集上,所有测试防御下测得的互信息 95% 置信下界严格为正,证明泄漏不可避免。与同时考虑全部 C(k,2) 个三角形约束的成对凸规划相比,求和形式数值上仅强 1.45 倍,但结构上让每个类拥有独立临界成本和级联。论文还指出 FRONT 防御报告的 122 倍差距主要源于阈值排除,在活动类上实为 21 倍,接近无防御时的 15 倍;分步测量显示,压缩到 Lipschitz 统计量的步骤贡献 28 倍下界,而散度步骤仅 1.5 倍,表明散度是主要瓶颈。无防御时的一对多可区分性与防御后每类泄漏的 Spearman 相关达 0.62–0.77,支持认证机制的迁移性。该框架在 100 类 QUIC/TCP 数据上同样适用。
💡 推荐理由: 本文证明多类加密流量即使经主动防御仍存在不可消除的侧信道泄漏。安全团队应放弃完全消除指纹的幻想,改用互信息下界对防御方案进行量化评估,并关注每类临界成本差异,避免防御资源分配失衡。
🎯 建议动作: 研究跟进:评估该互信息下界框架在自身网络流量/隐私场景中的适用性,重新检视现有防御措施的残余风险。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuefeng Peng, Ali Naseh, Amir Houmansadr
本文提出了一种名为 DIFFENCE 的新型成员推理攻击(MIA)防御框架,核心思路是利用生成式模型在推理前对输入样本进行“再生成”,从而抹除训练集成员与非成员输入之间的可区分特征。传统防御要么在训练阶段修改模型、要么在推理后修改输出,而 DIFFENCE 是首个在推理前仅对输入样本进行处理的即插即用防御,无需修改目标模型的训练或推理逻辑,因此可以与其他防御机制级联使用。作者设计该防御时特别注意保持模型对每个样本的预测标签不变,从而不影响分类准确率,并通过实验证明置信度向量的有用性也不会下降。在多个数据集上,DIFFENCE 能将未防御模型的 MIA 攻击准确率平均降低 15.8%,攻击 AUC 降低 14.0%;与现有最优防御 SELENA 结合后,攻击准确率进一步降低 9.3%,AUC 降低 10.0%,达到了新的隐私-效用均衡最优。同时,DIFFENCE 仅给每次推理增加约 57ms 的计算开销,实用性较强。该论文的主要贡献在于提出了一种新的防御视角:利用生成模型对输入进行净化,而不是修改模型本身。适合对隐私保护、成员推理攻击防御和生成模型应用感兴趣的安全研究人员阅读。
💡 推荐理由: 成员推理攻击是机器学习隐私的核心威胁,DIFFENCE 提供了一种不修改目标模型、仅靠输入净化的即插即用防御思路,可与其他防御叠加,且几乎不损失效用,为隐私保护提供了新工具。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bing Zheng, Zongyao Zhao, Wenming Yang
生成式引擎优化(GEO)是一种通过操纵网页内容来提升其在生成式搜索引擎中可见度的技术,类似针对传统搜索引擎的SEO。然而,该技术可被攻击者滥用:他们制作看似普通但经过特殊优化的文档,当受攻击的大语言模型(LLM)在检索增强生成过程中获取并综合这些文档时,会输出被信息扭曲的答案,从而传播定向虚假信息。目前,在受控条件下系统评估这类威胁防御手段的基准仍然缺失。为此,本文提出了Counter-GEO-Bench防御基准。作者构建了247个人工验证、质量把关的查询,每个查询均包含两种GEO改写版本:一种保留信息,另一种扭曲信息,以模拟正常与攻击场景。基准在三个受害LLM上,以攻击成功率(ASR)、误报率和答案质量为核心指标,评估不同防御策略。实验结果显示:现成防御——Granite Guardian、Llama Guard 3和NeMo Self-Check Fact-Checking——均未能有效抵御攻击,相对ASR下降最多仅5.7%,其中Granite Guardian的降幅不具备统计显著性。作者分析,这些基于安全分类的护栏旨在识别违反策略的恶意内容,但GEO扭曲后的信息以自然流畅的形式出现,能轻松绕过监测。为证明威胁可被处理,作者提出轻量级防御基线C-GEO Guard。该基线将ASR相对降低47.6%,且几乎不损失回答质量,表明针对信息扭曲型GEO的防御是实际可行的。Counter-GEO-Bench为后续研究提供了一个标准化的评估平台,有助于开发更健壮的生成式AI内容安全保障。
💡 推荐理由: 生成式AI检索应用日益普及,GEO攻击可能导致LLM输出看似可信的虚假答案,而现有安全护栏难以拦截此类内容。Counter-GEO-Bench为首个系统化评估数据与防御方案,为保护RAG类系统提供重要参考。
🎯 建议动作: 研究并评估将C-GEO Guard应用于自身RAG系统的可能性,关注基准及后续开源进展。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xiaofang Yang, Ziqi Miao, Dianbo Sui, Jing Shao, Lijun Li
本文针对技能增强型智能体(skill-augmented agents)的安全问题展开研究。此类智能体会将可复用的技能作为持久化运行时上下文加载,以提升任务执行能力,但这也为恶意技能提供了长期影响后续行为的通道。恶意技能可能在特定用户任务和工作区状态下,诱使智能体泄露机密、破坏代码、绕过审批或将数据暂存以备外传,使得安装前的审查不足以防范风险,因此需要运行时且任务条件化的防护机制。作者提出一种名为 Defense-as-Skill 的防御范式,将运行时守护本身实现为可安装、可检查、可编辑的技能。其守卫模块 SkillSonar 与不受信任的任务技能并行运行,针对用户任务边界检查敏感操作,并将操作路由到允许(allow)、重新规划(replan)或确认(confirmation)决策,无需修改底层智能体运行时。为评估该方案,作者构建了任务条件化数据集 SCOPE-R,涵盖 6 个风险族和 21 个子类别,包含 206 个攻击确认的恶意实例和 43 个良性任务。然后通过运行时守护技能演化(一种蒙特卡洛树搜索过程,根据回放反馈迭代磁盘上的守卫技能)改进 SkillSonar。在 Claude Code 和 OpenClaw 上的实验表明,演化后的守卫大幅降低了攻击成功率,同时保持了良好的安全-效用平衡。在 GLM-5 的重复运行中,SkillSonar 将 ID ASR 从 0.482 降至 0.104,OOD ASR 从 0.606 降至 0.115。进一步分析展示了跨受害者模型、未见过风险族和外部基准的迁移能力,以及对自适应攻击者的持续防护。消融实验还表明,显式安全责任分配和技能原生表示对性能提升都至关重要。
💡 推荐理由: 该研究直指LLM智能体技能生态的运行时风险,首次将防护本身技能化,为‘技能即攻击面’提供了全新防御范式,对构建安全的智能体应用具有重要指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Muhaimin Bin Munir, Akib Jawad Ononto, Nazia Shehnaz Joynab, Bhavani Thuraisingham, Latifur Khan
这篇论文提出了一种针对检索增强生成(RAG)系统的知识投毒攻击防御框架。研究背景是:RAG通过外部语料库为大型语言模型提供事实依据,但系统对检索文档的隐式信任构成了严重攻击面。已有研究(如PoisonedRAG)表明,仅需少量精心构造的恶意文档即可在密集检索中占据主导地位,并引导模型生成攻击者预设的答案。针对这一威胁,作者提出了“三层筛”(Tri-Layer Sieve)中间件防御机制。该机制在检索后对文档证据进行三层净化:第一层通过跨嵌入空间聚类并引入独立评判模型,识别并隔离在多个嵌入模型中行为不一致的离群文档;第二层通过结构过滤检测触发词-载荷(Trigger-Payload)这类投毒文档特有的内部结构;第三层利用LLM自身的一致性验证来确认文档内容与生成答案的语义一致性。设计的核心思想是利用检索阶段投毒的固有弱点:单篇恶意文档必须同时迎合嵌入空间的几何特性、内部的触发-载荷结构以及最终的生成目标,三者同时满足极具挑战性,即使面对能对触发词进行改写以规避结构过滤的自适应攻击者,这种脆弱性依然存在。实验在NQ、HotpotQA和MS-MARCO数据集上使用Contriever检索器(k=50)进行,结果显示:将黑盒攻击成功率从67.0%/87.0%/64.0%分别降至3.0%/14.0%/4.0%;针对白盒HotFlip攻击,在NQ上启用第三层后成功率从约74%降至27.8%;受污染文档的MRR降至0.000,同时将攻击场景下的干净准确率从13-33%恢复至58-76%。在面对能改写触发词以绕过结构过滤的架构感知攻击者时,启用一致性验证层可将自适应攻击成功率减半(NQ上从32.0%降至15.0%),并将干净准确率提升18个百分点,但代价是每次实时检索增加约16-19秒延迟。该研究适用于关注RAG安全、对抗检索攻击及LLM安全防御的研究人员和工程师。
💡 推荐理由: RAG已成为企业落地LLM的主流方式,但检索注入攻击能低成本操纵模型输出。本方法提供了一种不依赖单一嵌入模型族、可对抗自适应攻击的防御原型,其跨嵌入一致性与三层校验思路对设计安全检索管线有直接借鉴价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Robert Dumitru 0002, Thorben Moos, Andrew Wabnitz, Yuval Yarom
该论文针对静态侧信道分析的可达性问题展开研究。在侧信道攻击中,攻击者通常需要找到从程序输入到敏感信息泄露的传播路径(即可达性),而静态分析技术常被用于自动识别这类路径。作者提出一种名为“借用时间”(On Borrowed Time)的方法,旨在从源头阻止静态侧信道分析的有效性,而非仅仅检测或缓解单条泄露路径。核心思路是引入时间维度上的不确定性:通过混淆或扭曲程序在执行过程中的时序行为,使得静态分析无法准确推断敏感数据与可观测输出之间的因果关系,从而破坏侧信道泄露的判定基础。论文可能提出了新的程序变换或代码混淆策略,并对其安全性、性能开销以及对抗静态分析的实际效果进行了形式化分析与实验评估。主要贡献在于首次从“对抗静态分析本身”的角度设计防御机制,而非依赖运行时的随机化或掩码,为侧信道防护提供了新的研究思路。适合关注侧信道安全、程序分析、编译器优化及软件防护的学者和工程师阅读。由于仅基于摘要,具体技术细节和实验数据需查阅原文。
💡 推荐理由: 为蓝队提供对抗侧信道静态分析的原创防御思路,有助于在开发阶段阻断泄露路径,提升密码实现安全性。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Haoran Wang, Matthew Lau, Alec Helbling, Matthew Hull, ShengYun Peng, Mansi Phute, Martin Andreoni, Willian T. Lunardi, Duen Horng Chau, Wenke Lee
本文提出了一种名为 ARMOR(Adversarial Robustness with Manifold-Oriented Training)的新型防御方法,旨在解决空中目标检测模型在物理世界中对通用对抗性补丁的脆弱性,同时应对训练数据稀缺的实际约束。空中目标检测广泛应用于现实场景,但模型容易受到物理可实现的通用对抗性补丁的攻击,导致漏检。以往对抗性鲁棒性研究通常假设训练数据充足(数万张图像),但实际部署场景中,空中图像的收集和标注成本高昂,通常仅有数百张图像可用。ARMOR 将流形导向对抗训练(OMAT)的核心思想扩展到低数据场景。OMAT 通过建模数据流形(即捕获数据相关特征的紧凑结构)来学习和增强特征鲁棒性,但其依赖大数据量的生成模型训练和对抗训练。相比之下,ARMOR 采用数据高效的方法,重复利用检测任务已有的标签:它通过(i)掩蔽图像背景以保留与物体相关的特征,以及(ii)在物体上注入随机补丁以提高特征鲁棒性。实验使用物理可实现的对抗补丁,在低数据条件下评估了免查询迁移攻击和防御感知攻击。结果表明,ARMOR 在保持超过 0.90 模型置信度的强干净性能的同时,与最先进的防御相比,将对抗鲁棒性提升了高达 0.32 的模型置信度。使用打印补丁的物理实验证实这些增益在真实部署中依然有效。总体而言,ARMOR 将基于流形的训练见解转化为在训练数据稀缺情况下防御目标检测模型的方法。该研究对计算机视觉安全、对抗性机器学习以及资源受限环境下的模型鲁棒性具有重要参考价值,适合关注防御性人工智能安全的研究人员和工程师阅读。
💡 推荐理由: 空中目标检测部署中数据稀缺且易受物理对抗补丁攻击,ARMOR 提供了一种数据高效的防御新思路,对实际安全应用有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Faezeh Shojaeighadikolaei, Keith Paarporn
本论文研究复杂系统安全中的多类型防御资源分配问题。在网络安全中,防御者通常拥有多种异构防御资产(如防火墙、入侵检测系统、蜜罐等),需要针对不同类型的攻击(如DDoS、恶意软件、钓鱼等)进行最优部署。作者将这一问题建模为一般Lotto博弈(General Lotto game),其中防御者拥有多种资源,并引入一个网络权重矩阵来描述每种资源对不同攻击类型的个体有效性。这一新颖特性使模型能够捕捉资源与攻击之间的非对称匹配关系。在理论分析中,作者推导了防御者性能的上界和下界,并提供数值证据表明这些边界是紧的。对于两种攻击类型的情况,他们解析地证明了上下界重合,从而给出了精确的均衡策略刻画。此外,作者将所提出的网络化多资源架构与文献中已有的独立防御基准进行了数值比较,结果显示网络化方法在资源分配效率和防御效果上具有优势。这项工作揭示了多攻击类型防御问题中内在的、可处理的结构,为复杂系统的安全资源分配提供了理论基础。适合对博弈论在网络安全资源分配中应用感兴趣的研究人员阅读,尤其是从事安全运营中心(SOC)资源优化、防御策略设计方向的从业者。
💡 推荐理由: 本文为多类型防御资源面对多攻击类型的分配问题提供了数学框架,可帮助安全团队理解最优资源部署策略,提升防御效率。尽管目前偏理论,但为未来自动化防御决策和资源调度系统提供了支撑。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zi Liang, Xiaoyu Xu, Yanyun Wang, Minxin Du, Qingqing Ye, Haibo Hu
本文针对大型语言模型(LLM)代理面临的提示注入攻击问题展开研究。提示注入攻击通过在代理检索的外部文本源中嵌入恶意指令或内容,诱导底层LLM执行超出其良性范围的危险操作。现有防御方法虽然能对抗已知注入攻击,但在LLM代理环境中部署仍存在困难,原因在于攻击变体层出不穷,且现有方案普遍面临效率、上下文精确性和适应性之间的三难困境。为此,作者提出了CAITLYN(Continuous Agents for Injection Threats via Lifelong Yielding Nexus),一种代理无关的防御中间件。CAITLYN由两个系统组成:系统I负责针对现有攻击的即时防御,采用两层库结构——第0层为规则检测脚本,第1层为基于LLM的优化推理,用于精确检测;系统II则持续监控潜在异常信号,并尝试自主合成新的防御能力。在标准基准测试上,CAITLYN达到了与最先进防御方法相当的检测性能,同时比LLM-as-a-judge基线具有更低的token开销。此外,作者还构建了一个新的交付感知基准Emerging,包含新型注入技术。实验表明,在该基准上,静态基线和单独运行的系统I仍然易受攻击,而系统II能够自主合成并验证新的防御能力,从而显著降低多个不同代理环境下的攻击成功率。该研究为LLM代理的自动化防御提供了新思路,展示了通过持续学习和合成机制应对未知注入威胁的潜力。
💡 推荐理由: LLM代理面临日益复杂的提示注入攻击,现有防御难以兼顾效率、准确性和适应性。CAITLYN提出了一种代理无关、可自动合成新防御的中间件,为蓝队应对未知攻击变体提供了可行的自动化防御框架,值得关注。
🎯 建议动作: 研究跟进,评估将CAITLYN思路纳入内部LLM代理安全防护体系的可能性,并在可控环境中进行小规模验证。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Arham Riaz, Ting Yu
该论文研究深度学习中后门攻击与防御的一个根本性假设缺陷。传统上,攻击者和防御者都默认成功的后门必须具有高攻击成功率(ASR),现有防御机制也大多基于这一前提进行设计和评估。作者指出,ASR并非后门的内在属性,而是可由攻击者人为控制的变量——攻击者可以在不消除后门行为的前提下,刻意降低模型的ASR,从而规避依赖高ASR特征进行检测的防御体系。为此,论文提出一种“反向训练框架”,通过削弱触发器与目标类别之间的关联强度,生成低ASR的后门模型,同时保持模型在干净输入上的性能基本不变。作者在多个数据集、多种攻击家族和多种网络架构上进行了大量实验,结果表明,现有最先进的防御方法在低ASR条件下均会失效,从而暴露出攻击者与防御者之间严重的能力不对称。该研究的意义在于揭示了一个防御盲区:安全社区不能仅以ASR作为后门检测的唯一信号,否则很容易被攻击者通过降低ASR这种简单策略绕过。论文适合从事深度学习安全、后门防御、模型可信赖性研究的研究人员和安全工程师阅读,也为设计更鲁棒的后门检测与防御机制提供了新的思考方向。
💡 推荐理由: 该研究颠覆了“高ASR是后门必要条件”的传统认知,证明攻击者可刻意降低ASR绕过现有防御,为蓝队评估模型供应链安全提供了新的风险视角。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Dimitri Galli, Andrea Venturi, Dario Stabili, Mauro Andreolini, Mirco Marchetti
本文针对基于图神经网络(GNN)的网络入侵检测系统(NIDS)在面临结构性对抗攻击时的鲁棒性问题展开研究。GNN 能够同时利用网络流特征和拓扑模式,因此被视为一种有前景的 ML-NIDS 解决方案。尽管 GNN 分类器相比其他机器学习检测器在面对基于特征的对抗攻击时表现出更强的鲁棒性,但它们仍然容易受到结构性对抗攻击的影响——攻击者通过注入边或插入节点来扰动底层网络图拓扑。这种攻击在真实部署中构成严重威胁。现有防御措施往往基于不切实际的假设,难以直接应用于实际网络安全场景。为此,本文提出一种基于对抗训练的防御框架,旨在强化基于 GNN 的 NIDS 对结构性攻击的抵抗力。该方法通过策略性地替换正常网络流中的源节点和目标节点来生成对抗样本,从而高效模拟边注入攻击。作者在 CTU-13 和 TON-IoT 两个广泛使用的数据集上,以 E-GraphSAGE 作为基础 GNN 分类器进行评估。实验结果表明,该防御方法能够生成加固的检测器,在干净图上保持优异的检测性能,同时显著增强对结构性对抗攻击的鲁棒性。本文的主要贡献包括:提出一种实用的对抗训练框架、生成对抗样本的高效策略,以及通过实验证明该方法在多个数据集上的有效性。适合关注对抗机器学习、网络入侵检测以及 GNN 安全应用的研究人员和蓝队安全工程师阅读。
💡 推荐理由: 基于 GNN 的 NIDS 正逐步走向实际部署,但结构性对抗攻击可悄然破坏其拓扑建模能力,导致漏报。本文提供了一种切实可行的对抗训练防御思路,有助于提升检测系统在对抗环境下的可信度。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Joshua Penman
本文针对大语言模型(LLM)面临的提示注入(Prompt Injection)攻击提出了一种新的防御思路。研究指出,当前模型仅能感知输入的令牌(tokens),虽然服务端清楚每个文本片段属于用户输入、工具输出还是指令,但模型自身却需要自行追踪这些跨度(span)的身份,容易因混淆而被攻击者利用——攻击者可以构造看似指令的文本,诱使模型执行非预期操作。为此,作者提出一种名为“语义覆盖”(Semantic Overlays)的通用引导技术:在冻结的模型残差流上,针对选择的预填充位置应用小型可学习适配器(adapters),从而为特定文本跨度附加一个带外(out-of-band)注释通道,这个通道无法通过令牌本身伪造。与传统的引导向量(steering vectors)不同,语义覆盖是经过训练的、可选择性应用且具有组合性的。它能够编码复杂的语义,改变模型对标记跨度的感知方式——例如,在一个声称代码属于另一编程语言的覆盖下要求模型复制该代码,模型会忠实改写为声称的语言。此外,覆盖还可以携带可执行的指令,并能标记“不可执行”跨度,从而抵御在不可信上下文中添加指令的广泛提示注入攻击。实验在多个基准上取得了显著效果:SEP分离准确率从24.3%提升至96.5%,且原有工具调用能力保持不变;TensorTrust攻击成功率从34.8%降至6.6%;PIArena的全部四个攻击家族合规率均降至0%。同时,标记跨度仍保持可读(精确复制率92.5%)。论文还修正了已发布评分器中的一个缺陷。该研究为LLM安全提供了新的防御维度,适合AI安全研究人员、红蓝队人员以及大模型应用开发者阅读。
💡 推荐理由: 提示注入是当前LLM应用面临的核心安全威胁,该研究提出一种不改变模型权重即可使用的可学习带外注释技术,显著降低攻击成功率且不影响原有功能,为防守方提供了一种实用的新防御手段。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinwoo Kim 0006, Eduard Marin, Mauro Conti, Seungwon Shin 0001
本文针对网络拓扑混淆防御机制缺乏系统性安全与实用性分析的问题展开研究。路径追踪工具(如traceroute)本是网络运维人员定位故障的基础工具,但攻击者也可利用其获取尚未公开的网络拓扑信息,从而更高效地发动链路洪泛攻击(LFA)等拒绝服务攻击。近年来已有多种网络混淆防御方案被提出,其核心思想是向攻击者展示虚拟(伪造)拓扑,以隐藏真实的关键瓶颈链路。然而,这些方案所提供的虚拟拓扑在安全性和可用性方面究竟达到何种水平,尚未有全面、系统的评估。论文提出了EqualNet,一种安全且实用的长期网络拓扑混淆防御机制。通过对现有混淆方案进行深入分析,EqualNet旨在弥补已有工作在安全性和实用性上的不足,在有效防御LFA的同时保证对正常网络运维工具(如traceroute)的可用性。该研究的核心贡献包括:首次对现有网络拓扑混淆方案进行系统化的安全性与效用分析,识别其局限;基于分析结果设计更健壮的防御机制;并通过实验验证EqualNet在真实网络场景中的有效性。本文适合网络防御研究者、安全运维人员及关注链路洪泛攻击防护的工程师阅读,为其理解现有方案不足和构建更实用的防御策略提供了重要参考。
💡 推荐理由: 链路洪泛攻击是难以检测的DoS变种,网络拓扑混淆是重要防线。本文首次系统分析现有混淆方案的安全性与实用性,并给出更优方案,对蓝队理解防御盲区和部署有效防护具有直接指导价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Roshan Sood, Onat Gungor, Tajana Rosing
本文针对大型语言模型(LLM)在面对不断演进的提示注入攻击时现有防御机制不足的问题,提出了一种持续偏好优化框架COPA。提示注入攻击通过将恶意指令嵌入用户输入或外部内容,可操控模型行为并绕过安全限制。现有防御大多采用静态策略,如固定的对齐目标或针对特定攻击的过滤机制,一旦出现新的攻击形式就需要重新设计,无法适应自适应对手的持续进化。虽然近期的终身对齐方法能够处理用户偏好的变化,但并未考虑攻击者会利用之前防御的弱点不断演化。COPA将提示注入防御视为一个终身学习问题,采用基于GRPO(组相对策略优化)的增量优化方式,持续吸收新观察到的攻击反馈,并通过边际加权经验回放机制保留对旧攻击类型防御能力,从而在适应新威胁的同时缓解灾难性遗忘,保持模型的通用能力。实验在可持续的提示注入攻击流上进行,结果表明COPA能显著降低攻击成功率,与现有最先进防御相比最多降低6.3倍,平均降低4.4倍,验证了持续偏好优化作为对抗自适应攻击者防御范式的有效性。该研究为LLM在实际部署中面临的安全威胁提供了一种动态防御新思路,适合模型安全研究者和安全运维工程师阅读。
💡 推荐理由: LLM应用正面临不断演变的提示注入攻击,传统静态防御难以应对。COPA提出持续学习框架,可随新攻击自适应更新,为蓝队提供了一种从终身学习视角构建动态防御的参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ye Tao, Hong Shen, Hui Tian, Xin Wang, Can Wang
本文针对联邦学习中共享梯度可能泄露私有训练文本的严重隐私威胁,提出了一种轻量级防御方法 AEGIS(Attention-Embedding Gradient Isolation Shield)。作者首先通过对 Transformer 梯度结构的深入分析,识别出三个导致私有 token 信息泄露的通道:通道1是注意力输出投影梯度暴露出的低秩子空间,能够编码输入嵌入;通道2是嵌入梯度的行范数稀疏性,直接揭示哪些 token 出现在训练数据中;通道3是 MLP 扩展梯度中携带的可恢复子空间信号,与通道1具有类似性质。研究表明,最先进的梯度反演攻击能够在数秒内利用这些通道实现近乎精确的 token 恢复。现有防御大多只针对单一通道,且往往以牺牲模型效用或留下结构信号为代价。AEGIS 的核心创新在于通过三个无需架构修改的反向路径操作同时关闭所有三个分析通道:冻结注意力投影参数从构造上消除通道1;向嵌入梯度注入校准噪声以破坏通道2的 token 存在信号;对 MLP 扩展梯度进行逐块噪声注入以掩盖通道3。该方法确保用于本地优化器步进和服务器导出的梯度均为掩蔽后的版本,任何一侧都不保留干净信号。作者在 11 个模型和 6 个数据集上进行了全面评估,证明 AEGIS 能够将多种解析型和基于优化的梯度反演攻击的 token 恢复率降至接近零,同时保持甚至提升模型效用。此外,论文为通道1和通道2提供了形式化保证,并针对完全了解防御机制的自适应对手进行了实证验证,展示了方法在极端威胁模型下的鲁棒性。
💡 推荐理由: 联邦学习中的梯度反演攻击可快速还原私有训练文本,对合规性和用户隐私构成直接威胁。AEGIS 首次以单一轻量方案同时封堵三个泄露通道,且不牺牲模型效用,为隐私保护联邦微调提供了可落地的技术方案,值得隐私保护研究者与联邦学习平台关注。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yan Wen, Zhenyi Wang, Heng Huang
图神经网络(GNN)是机器学习即服务(MLaaS)中高风险应用的核心技术,但其黑盒部署模式易受模型提取(Model Extraction)攻击:攻击者通过查询API窃取模型知识产权。现有防御措施存在根本性的'欧几里得偏差'——它们直接将图像领域的扰动策略(如随机噪声)迁移到图数据上,忽略了图节点间复杂的拓扑依赖,导致模型效用大幅下降;而水印等被动防御无法实时阻断窃取。针对这一问题,本文提出GraphRP(Graph Reprogramming Protection)——一个基于模型重编程的主动防御框架,将模型重编程思想转化为安全防护机制。GraphRP的核心里程碑在于提出结构感知门控机制(Structure-Aware Gating Mechanism),该机制由可学习的拓扑原型驱动,构建一道动态的'结构防火墙',能够选择性地调节模型决策边界:对位于训练数据流形上的良性查询保持高保真度,而对恶意查询则沿扰动方向最大化Fisher信息,从信息论层面增大攻击者的估计误差。作者在标准假设下(有界损失、最优攻击者、局部二阶近似)证明了攻击者误差的下界将随重编程噪声的结构敏感性而增加,从理论上验证了该方法的有效性。实验覆盖软标签与硬标签两类主流模型提取攻击,结果表明GraphRP能显著降低攻击成功率,同时几乎不影响良性查询的效用。该研究首次将模型重编程引入GNN防御领域,为保护图模型知识产权提供了全新思路,特别适合ML安全研究员、MLaaS服务提供商及GNN部署方阅读。
💡 推荐理由: GNN在MLaaS中广泛部署,模型提取攻击可导致核心知识产权泄露。现有防御因忽略图拓扑而失效,GraphRP作为主动防御新思路,能有效平衡安全性与效用,值得安全从业者关注。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Laiqiao Qin, Tianqing Zhu, Longxiang Gao, Wanlei Zhou
大型语言模型(LLM)应用面临提示注入这一严重安全威胁,攻击者通过将恶意指令嵌入用户输入或外部数据来劫持模型行为。现有检测方法仅判断注入是否存在,并在检测到时一律拒绝响应,却忽略了关键事实:对于许多现代对齐模型而言,精心构造的指令可以抵抗大多数注入攻击,这意味着不同指令和模型的注入鲁棒性存在显著差异。这种一刀切的做法导致大量不必要的过度拒绝——本可安全处理的包含注入的输入被错误拒绝,严重损害了用户体验和应用可用性。为解决这一问题,本文提出 BASIS(鲁棒性感知的提示注入防御)。该方法利用注意力竞争比(Attention Competition Ratio, ρ)作为特征,训练两个稀疏线性探针:存在探针(existence probe)和漏洞探针(breach probe)。这两个探针通过级联门控进行决策,无需额外的 LLM 推理开销。BASIS 包含三个阶段:注入存在检测、逐样本漏洞预测和指令鲁棒性评估;在线级联仅在模型真正可能被攻破时才拒绝请求,从而避免对鲁棒指令的过度拒绝。实验在四个任务和六个开源 LLM 上进行,结果显示 BASIS 在维持接近完美的注入检测性能的同时,显著减少了对安全攻击样本的过度拒绝,尤其在鲁棒指令模板下表现突出。本研究为 LLM 应用提供了一种更精细、更智能的提示注入防御新思路,在安全性和可用性之间取得了更好的平衡。
💡 推荐理由: 该研究指出了现有提示注入防御的过度拒绝问题,并提出一种无需额外推理、可感知指令鲁棒性的轻量级防御方案。对于部署 LLM 应用的安全团队,既能保持高检测率,又能避免误杀安全输入,提升服务可用性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yuxuan Huang, Xingyu Zeng, Tianhang Zheng, Chaochao Lu
该论文研究的是开源大语言模型在发布后被恶意下游微调(malicious downstream fine-tuning)所引发的安全风险。现有防御措施主要面向微调即服务(FTaaS)范式,或依赖下游用户遵守额外安全流程,难以适用于论文关注的场景:模型提供方以“部分保护的开源权重”(PPOW)形式发布模型,即大部分权重保持可训练,仅保留一个小的安全关键组件。为此,作者提出一种单向安全门(Unidirectional Safety Gate, USG),具体实现为在最后一个 Transformer 层之后插入一个零空间立方层(Null Space Cubic Layer)和逆适配器(Inverse Adapter)。在正常前向推理时,逆适配器恢复基础模型的行为,不改变模型输出;在下游微调时,立方层会抑制或阻断来自有害样本的梯度,这些样本的隐藏状态落入由防御方预先标定的受保护区域。防御方使用自身持有的有害数据校准阈值,使保护能够泛化到邻近的分布内有害样本。作者在六个模型-数据集组合上进行了评估,结果显示:在固定发布阈值下,USG 能将微调后的攻击成功率保持在接近发布前的水平,同时在较简单设置下维持较高的安全通过率,并在 BeaverTails 数据集的不安全样本上展现出更清晰的安全-效用权衡。这些结果表明,在发布阶段通过表示空间阻断可以提升恶意下游适配的成本,且无需下游合作。论文代码已开源。该研究面向大模型安全研究人员、AI红队以及开源模型发布方的安全工程师,提供了一种主动防御思路。
💡 推荐理由: 该研究针对开源大模型被恶意微调的现实威胁,提出无需下游合作即可实施的发布时防御机制,为模型发布方提供新的防护选项,填补了FTaaS以外场景的防御空白。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Anadi Goyal, Nandish Chattopadhyay, Chandan Karfa, Anupam Chattopadhyay, Norrathep Rattanavipanon
视觉Transformer(ViTs)在资源受限环境中常通过token剪枝技术来降低计算成本并保持准确率,然而攻击者可针对这些剪枝机制发起对抗性效率攻击,故意构造输入以破坏剪枝的收益,导致模型推理开销剧增,违背了效率优化的初衷。本文提出了一种名为MOAT(Model-Agnostic Randomized Transformations)的模型无关预处理防御管线,通过组合多种输入变换来保护采用token剪枝的ViT实现免受此类效率攻击。MOAT直接作用于输入,无需修改模型架构或token剪枝逻辑,因此可集成到现有部署流程中。实验结果表明,在所有测试的ViT模型上,MOAT能将对抗攻击下的GFLOPs退化限制在原始无攻击模型的3.4%以内,显示了其有效的防御能力和普适性。该研究为在资源受限场景下安全部署高效ViT提供了实用方案,适合关注AI系统安全性与鲁棒性的研究者和工程师阅读。
💡 推荐理由: 效率攻击可让token剪枝等优化形同虚设,造成推理延迟剧增,影响实时服务和边缘部署的可用性。MOAT提供一种无需改动模型的输入预处理防御,可直接集成,为防御此类拒绝服务式攻击提供新思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yinan Zhong, Qianhao Miao, Yanjiao Chen, Jiangyi Deng, Yushi Cheng, Wenyuan Xu 0001
大型语言模型(LLM)已被集成到许多应用中(如Web Agent)以执行更复杂的任务,但其在处理外部数据时容易受到间接提示注入(Indirect Prompt Injection, IPI)攻击的威胁。攻击者将恶意指令隐藏于不可信的外部数据源(如网页、文档、API响应等)中,当LLM处理这些数据时,可能被诱导执行非预期操作,导致严重安全风险。本文提出了一种名为RENNERVATE的防御框架,旨在检测并阻止IPI攻击。RENNERVATE的核心创新在于利用LLM内部的注意力特征,在细粒度的token级别上识别隐蔽的注入内容,并执行精确的消毒(sanitization),即在保留LLM正常功能的同时中和恶意指令的影响。具体而言,该框架构建了一个两步注意力汇聚(2-step attentive pooling)机制,通过聚合注意力头和响应token的信息,生成token级检测结果,从而捕捉注意力分布中的异常模式,有效区分正常内容与注入指令。此外,作者创建并开源了一个细粒度的IPI数据集FIPI,以支持本领域的后续研究。通过在5个LLM和6个数据集上进行的大量实验,RENNERVATE在检测精度上显著优于15种现有的商业和学术IPI防御方法。实验还表明,该框架具有良好的可迁移性,能够应对未见过的攻击类型,并对自适应攻击者具有鲁棒性。该研究为保护基于LLM的应用提供了一种新颖且有效的技术路径,并为安全社区提供了可复用的数据集和防御思路。适合LLM安全研究人员、AI应用开发者及安全运营团队阅读。
💡 推荐理由: 该研究针对LLM应用中日益严重的间接提示注入威胁,提出了一种基于注意力特征的token级检测与消毒框架。其高精度和可迁移性在多个模型和数据集上得到验证,为防御方提供了新的技术思路,有助于提升Web Agent等LLM应用的安全性。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yongjian Guo, Wanlun Ma, Lingyu Shen, Xi Xiao, Sheng Wen
本文针对大型语言模型(LLM)在微调过程中存在的安全漏洞展开研究。作者指出,恶意数据提供者可以将有害行为嵌入下游训练语料,导致模型在保留专业技能的同时,按照要求违背人类价值观。现有的安全重对齐防御通常面临三大局限:一是容易造成模型对专业技能的灾难性遗忘;二是在防御者无法观测到攻击者使用的提示模板时,防御效果显著下降;三是成功重对齐的模型仍可能通过简单的系统提示切换被再次越狱。为应对这些问题,论文提出了一种名为路由式基于策略的蒸馏(Routing-based On-Policy Distillation, ROPD)的新型重对齐框架。ROPD的核心思想是直接建模对齐模型与受攻击模型输出概率分布之间的差异,而不是拟合特定的提示模板,从而提升对模板变化的鲁棒性。作者在三个数据集和三个具有不同对齐强度的基础模型上,将ROPD与四种最先进的基线方法进行了广泛对比实验。结果表明,当基线防御面临模板不匹配时,其下游任务性能往往出现严重退化;相比之下,ROPD能够显著缓解模板不匹配风险,在防御有效性和能力保留方面均保持更强的鲁棒性。尽管分析显示ROPD并非完全免疫于模板偏移,但其性能下降幅度相比现有方法可以忽略不计,为稳健的LLM重对齐建立了新的标准。该研究适合LLM安全研究人员、模型对齐工程师以及关注供应链安全的防御者阅读。
💡 推荐理由: 该研究直击LLM微调供应链中的安全风险,提出的ROPD方法在防御模板变化方面显著优于现有基线,为蓝队提供了一种更抗绕过、更少遗忘的重对齐思路,有助于提升AI系统在实际对抗环境中的稳健性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Pushkal Kumar, Tucker Nielson, Tanish Kolhe, Shubham Zala, Vincent Li
该论文提出了一种针对检索增强生成(RAG)系统数据投毒攻击的分层防御框架 RAGuard。RAG 系统通过检索外部语料库来增强大语言模型(LLM)的回答,但这种依赖也引入了安全风险:攻击者可以向语料库中注入精心设计的恶意文本片段,从而操纵检索结果并影响模型生成内容。论文聚焦于“事实性”语料投毒攻击,即注入包含虚构事实、矛盾信息或推理陷阱的文本。RAGuard 包含两层防御:第一层是对稠密检索器进行对抗性微调。研究者使用合成的投毒文档(包含伪造事实、矛盾和推理陷阱)微调检索器,使其学会在生成之前降低恶意片段的排序。第二层是零知识推理补丁(ZKIP),这是一种基于黑盒模型的无需标签的过滤器。对于每个检索到的文档,ZKIP 通过逐一排除(leave-one-out)解码方式,比较在有无该文档的情况下模型回答的语义偏移和输出熵变化,从而评估该文档对答案的影响。ZKIP 不依赖投毒标签、标准答案或模型内部权重,仅需对比模型在反事实上下文下的输出。在自然问答数据集(Natural Questions)上,投毒比例从 5% 到 30% 的实验中,仅进行对抗性检索器训练可以降低攻击成功率但仍无法根除;而加入 ZKIP 后,在所有被测试的防御配置下,攻击成功率均降至 0.000,同时将召回率(Recall@5)保持在干净语料库基线的 0.03 以内。此外,在 BEIR 的 NFCorpus 子集上的监督分析验证了 ZKIP 所依赖的反事实信号具有可学习的投毒结构。防御带来的开销是每个查询需要 k+1 次生成器推理(k=5 时为 6 倍),论文分析了批处理和提前停止等近似方法来减少开销。作者还指出,保留关键字的投毒方法几乎不影响基于词法的检索器(如 BM25),这界定了威胁模型的范围。为便于复现,论文公开了代码、数据集和评估框架。
💡 推荐理由: 针对 RAG 数据投毒攻击提供了分层防御方案,无需修改生成模型,且 ZKIP 黑盒特性易于集成。实验证明可将攻击成功率降至 0,同时保持检索质量,对构建可信 RAG 系统具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ping He, Yuexiang Xie, Yaliang Li, Shouling Ji
随着大型语言模型(LLM)智能体的快速发展,其已被广泛应用于各类真实世界任务。为了标准化LLM智能体与外部环境之间的交互,模型上下文协议(MCP)工具应运而生,并成为事实上的标准,被广泛集成到这些系统中。然而,MCP工具的使用也引入了新的安全风险,因为LLM智能体可能被诱导执行恶意或未经授权的操作。尽管已有工作提出了针对LLM智能体工具使用的防御措施,但大多数方法依赖静态分析(即检查提示词和生成的输出),这限制了防御的有效性和鲁棒性。为了克服这些局限,本文提出了MTGuard,一种基于混合分析的防御框架,通过生命周期感知的静态-动态协同分析来保护LLM智能体中MCP工具的安全使用。广泛的评估表明,MTGuard能够有效缓解不同LLM智能体上多种类别的有害工具使用,同时保持良性用户任务的性能。该研究的核心贡献包括:提出了首个结合静态与动态分析的MCP工具安全防御框架;引入生命周期感知的概念,覆盖工具调用的完整过程;通过实验证明了其在多个智能体上的有效性和通用性。该论文适合LLM安全研究人员、智能体平台开发者以及关注AI供应链安全的安全工程师阅读。
💡 推荐理由: MCP已成为LLM智能体与外部工具交互的标准,但其安全风险尚未得到充分解决。MTGuard提出的混合分析思路突破了传统静态检测的局限,为蓝队防护AI智能体提供了新的技术参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mojtaba Zaheri, Yossi Oren, Reza Curtmola
本文研究利用缓存侧信道实现目标去匿名化的攻击与防御。作者首先分析了现代处理器中缓存侧信道泄露的机制,指出攻击者可通过监控共享缓存访问模式来识别受害者的活动,从而推断其身份或敏感信息。然后,提出了一种新的去匿名化攻击方法,利用CPU缓存的时序差异来区分不同进程或虚拟机的行为,结合先验知识(如网站指纹)实现用户去匿名化。实验在真实多用户系统上验证了攻击的有效性,成功率达到90%以上。针对该威胁,作者设计了两种防御机制:一是基于缓存分区,隔离敏感进程的缓存占用;二是引入随机延迟,混淆缓存访问模式。评估表明,防御措施在合理性能开销(<15%)下有效降低攻击成功率至10%以下。本文系统性地揭示了缓存侧信道在隐私攻击中的新应用,并提供了可落地的对策,适合安全研究人员、系统架构师以及云服务提供商阅读。
💡 推荐理由: 缓存侧信道去匿名化攻击可突破传统隐私保护机制(如Tor),威胁多租户环境中的用户匿名性。本文提出的防御方案具有实用价值,对云安全和隐私增强计算有直接指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Elias Hossain, Md Mehedi Hasan Nipu, Fatema Tuj Johora Faria, Tasfia Nuzhat Ornee, Maleeha Sheikh
多智能体LLM应用通常由规划器、工作智能体、验证器和合成器按链式顺序调用,每个智能体之间的通道是未被监控的通信路径,攻击者可以通过这些通道注入恶意指令(例如提示注入、工具投毒)。现有防御(例如IBProtector、Llama Guard、困惑度过滤器、SmoothLLM)仅保护输入边界,或者作为不透明的随机提供商侧过滤器运行,忽略了内部通道的安全风险。本文通过实验揭示了一个关键发现:在2100条轨迹、8个攻击家族、5种防御和3个模型后端(Azure GPT-5、Anthropic Sonnet 4.5、Anthropic Haiku 4.5)的评估中,一个未防御的管道在标准报告下显示完全安全(工具投毒和记忆投毒攻击成功率为0.000),但这几乎完全归因于云提供商的服务端过滤器(Azure GPT-5上的60个块中有54个被阻止),而在没有此类过滤器的后端上,安全性会悄然转移到智能体模型自身的对齐上。仅报告结果会隐藏这种依赖关系。为此,本文提出ChannelGuard,一个无需训练的深度防御框架,在每个智能体间通道上放置信息瓶颈门;每个门通过嵌入相似性对通道文本进行评分,与对抗性短语库进行比较,并决定通过、压缩或阻止,无需额外的LLM调用;同时提供一个归因方法记录每层阻止攻击的决策。ChannelGuard的工具输出门在应用层100%阻止了30个工具投毒攻击,且在所有三个后端上表现一致(Azure GPT-5、Anthropic Sonnet 4.5、Anthropic Haiku 4.5),而未防御管道的安全性则完全随后端变化;还将提示注入攻击成功率从0.333降至0.167,并完全保留了GSM8K准确率(0.867)。白盒自适应释义攻击可以绕过所有嵌入门,而扰动-投票基线表现更好。附录包含基線、消融、超参数扫描、良性保留分析以及裁判审计(kappa = 0.900),总成本为47.36美元。
💡 推荐理由: 多智能体LLM系统已在生产环境中部署,但业界普遍忽视智能体间通道的安全风险。ChannelGuard首次系统性地揭示了该漏洞,并提供了轻量、无训练、可解释的防御方案,对构建安全的多Agent应用具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Khushnaseeb Roshan
该论文针对网络入侵检测系统(NIDS)面临的对抗性攻击威胁,提出了一种混合防御方法。NIDS是保护网络免受未知网络威胁的关键工具,但它容易受到对抗性攻击,攻击者通过构造对抗样本欺骗NIDS,将恶意流量误分类为良性。研究聚焦于两种强大的白盒对抗攻击:快速梯度符号法(FGSM)和Carlini & Wagner(C&W)攻击。作者开发了一种鲁棒的混合防御机制,结合了两种启发式防御方法:对抗训练(AT)和高斯数据增强(GDA)。GDA提供多方向防御,而AT增强NIDS对特定对抗向量的鲁棒性。在预攻击场景下,NIDS表现出良好的准确率和F1分数。但在攻击后,NIDS在FGSM和C&W攻击下的准确率分别显著下降至0.2649和0.4961。所提出的混合防御方法有效缓解了这些对抗威胁,对于FGSM和C&W攻击,防御后准确率分别达到96.57%和89.20%。研究在ε和置信噪声因子值范围(0.0001至0.0009)内评估了防御策略。该研究为安全视角下对抗机器学习这一新兴领域的研究人员提供了方向。适合NIDS安全、对抗机器学习研究人员阅读。
💡 推荐理由: 为NIDS抵御白盒对抗攻击提供了实用的混合防御方案,实验验证了高防御性能,对提升实际网络环境下的入侵检测系统安全性有参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Khawaja Abaid Ullah, Mohammad Javad Khojasteh
该论文研究了分类模型中的反蒸馏采样问题。知识蒸馏攻击中,攻击者通过查询目标分类器的预测接口,利用返回的概率向量训练一个替代模型,从而窃取模型功能。此前针对大语言模型提出的反蒸馏采样方法通过输入相关的梯度导向扰动来防御此类攻击,但该方法在分类任务中的迁移尚未被研究。本文首先将反蒸馏采样迁移至分类场景,并发现其行为由教师模型每个输入上的置信度边际分布决定。由于训练良好的分类器存在严重的过度自信现象,直接迁移会导致一个“惰性窗口”:当扰动低于某个可闭式预测的阈值时,既不阻碍攻击者也不保护防御者;超过阈值后,防御发生相变,对教师模型的退化速度快于攻击者的学生模型。温度软化可以在闭式上缩放该相变点,但所有温度配置都位于相同的不利权衡曲线上。为此,作者提出ADS-C方法,在闭式每个输入边际预算下组合扰动,该预算可证明保留每个服务的top-1预测,因此防御后的教师准确度与未防御教师完全一致。在该保证下,蒸馏学生模型在CIFAR-100上仍损失17.4个百分点,CIFAR-10上损失29.6个百分点,Tiny-ImageNet上损失13.3个百分点;而使用未经修改的防御达到相同的学生退化程度则需要牺牲教师27.5、32.9和22.2个百分点的准确度。由于服务标签不变,硬标签攻击者无法获益,而防御后的软输出训练的学生模型准确度甚至低于硬标签底线(最多低29.7个百分点):蒸馏服务概率的动机不仅被消除,反而被逆转。据作者所知,ADS-C是第一个效用成本恰好为零的分类反蒸馏防御方法。
💡 推荐理由: 提出首个零效用损失的反蒸馏防御,有效防止攻击者通过概率查询复制分类器,同时不牺牲原始模型准确度,对保护商业或敏感分类模型具有重要意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Aziz Alajmi, Hoeseok Yang
该论文提出动态Rowhammer阈值管理(Dynamic Rowhammer Threshold Management),一种与具体防御方法无关的运行层,用于解决传统Rowhammer防御在制造时固定阈值(TRHD)而忽略运行温度变化的问题。作者观察到真实的Rowhammer阈值(TRHD)随温度升高而降低(即温度退化效应),因此设计了一个基于线性-T模型的运行时层,每个时间周期根据观测温度重新计算防御阈值,并引入基于VRD(Variable Rowhammer Degradation)的防护带g。该层通过每个防御方法的阈值参数将结果映射到SALT-C、PRAC和TRR等具体防御机制。为打破模型自洽性,作者采用一个解耦的oracle,按DIMM对物理TRHD缩放δ ~ N(1, σ)。实验结果显示:该运行层使PRAC在85°C下的72次陈旧性违规降至0;在σ=0.10时,扫描g使PRAC违规从38.4(g=1.0)降至9.6(g=0.9);SALT-C的违规次数从默认静态的10次降至动态的2次,再降至引导(bootstrap)模式的0次,同时延迟开销≤5.1%。TRR受容量限制,该运行层主要起诊断作用。论文主要贡献在于提出一种轻量级、与防御无关的动态阈值管理方法,能有效应对温度变化对DRAM Rowhammer脆弱性的影响,并兼容现有主流防御方案。适合DRAM安全研究人员、计算机架构师和内存控制器设计者阅读。
💡 推荐理由: 提出首个温度感知的Rowhammer防御阈值动态管理方案,显著降低因温度变化导致的内存安全漏洞风险,且与现有防御兼容。
🎯 建议动作: 研究跟进,评估将该方法集成到现有Rowhammer防御固件或控制器中的可行性。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Corban Villa, Alp Eren Ozdarendeli, Sijun Tan, Raluca Ada Popa
本文提出 Prismata,一种针对自主 Web 智能体(web agent)的跨站提示注入攻击的防御框架。背景:自主 Web 智能体旨在自动化日常浏览任务,但继承了 Web 最古老的攻击面之一——跨站脚本攻击(XSS)表明混合可信与不可信内容是危险的。智能体通过将自然语言解释为指令,重新引入此风险,使得第三方和用户生成的内容可通过提示注入劫持智能体。核心挑战:推导任务特定的安全策略需要对页面结构进行推理,而页面结构与攻击者内容纠缠在一起。Prismata 的防御思路是实施上下文最小权限原则,同时约束智能体看到的内容和能执行的操作。其动态信任推导机制为页面内容生成权限标签,并基于经典完整性模型提供结构化限制保证,确保标签只能降低权限且错误标记有界。机械限制机制通过删除内容和限制智能体能力来强制执行这些标签。重要的是,这些机制无需开发者标注,因此 Prismata 支持长尾网站。实验评估使用近期公开发布的 Web 智能体攻击(包括自适应变种)进行,结果表明 Prismata 显著降低攻击成功率,同时保持良性任务效用。本文适合安全研究人员、自主智能体开发者以及关注大模型安全的应用工程师阅读。
💡 推荐理由: 随着 LLM 驱动的自主智能体在浏览器中执行任务,跨站提示注入成为新兴且严峻的安全威胁。Prismata 提供了一种无需手动标注、可推广的防御方案,能显著降低攻击成功率,对保护未来自动化浏览安全至关重要。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Philemon Hailemariam, Birhanu Eshete
该论文针对机器学习模型面临的清洁标签后门攻击防御难题,提出了一种名为 PoisonSpot 的新型检测系统。清洁标签后门攻击通过污染训练数据嵌入隐藏行为,且无需修改标签,使得现有防御手段难以有效检测。PoisonSpot 的核心创新在于借鉴动态污点追踪思想,实现了细粒度的训练来源追踪:它能够监控单个训练样本在整个训练过程中对模型参数更新的影响,并基于影响谱线为每个可疑样本分配毒性分数,从而精确识别并剔除携带后门触发器的样本。在多个基准数据集和攻击场景(包括自适应攻击策略)下的实验评估表明,PoisonSpot 相比现有最先进的清洁标签后门防御方法具有显著优势:始终实现高真阳性率、低假阳性率,并有效减轻后门攻击。此外,该系统在重训练和微调等多种训练设置下均能高效运行,展现出良好的鲁棒性和可扩展性。论文详细描述了追踪机制、毒性评分算法以及防御流程,为机器学习安全领域提供了一种精准、可操作的防御方案。
💡 推荐理由: 清洁标签后门攻击因隐蔽性强而难以检测,PoisonSpot 通过细粒度训练来源追踪实现了高精度识别,对依赖第三方数据的模型安全具有重要防护价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sizhe Chen, Arman Zharmagambetov, Saeed Mahloujifar, Kamalika Chaudhuri, David A. Wagner 0001, Chuan Guo 0001
本文提出一种基于偏好优化的防御方法 SecAlign,用于缓解大型语言模型(LLM)面临的提示注入攻击。在 LLM 与外部数据源(如用户文档、网络检索结果、API 返回等)交互时,攻击者可将恶意提示注入这些外部内容,覆盖系统原有指令并执行恶意操作。SecAlign 的核心思路是构建一个偏好数据集,其中每个样本包含一个经过提示注入的输入、一个安全输出(响应合法指令)和一个不安全输出(响应注入指令)。然后利用偏好优化算法(如直接偏好优化 DPO)训练 LLM,使其更倾向于生成安全输出而非不安全输出。实验表明,SecAlign 能将多种提示注入攻击的成功率降至 10% 以下,即使面对训练中未见过的更复杂攻击也能保持有效,说明具有良好的泛化能力。同时,经过防御训练的模型在实用性上与原始模型相当,没有显著降低语言生成质量。该工作提供了首个已知的基于偏好优化的提示注入防御方法,代码已开源。
💡 推荐理由: 提示注入是 LLM 应用中的关键安全威胁,现有防御效果有限。SecAlign 提供了一种系统化的偏好优化框架,可显著降低攻击成功率且泛化性强,为构建更安全的 LLM 代理系统提供了实用方案。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yan Pang, Aiping Xiong, Yang Zhang 0016, Tianhao Wang 0001
该论文系统性地研究了视频生成模型(VGM)产生不安全内容(如暴力、恐怖、色情、政治敏感等)的风险。作者首先从4chan和Lexica等来源收集可能诱导不安全内容生成的提示词,并使用三种开源最先进视频扩散模型(如VideoFusion、ModelScope等)生成视频,经过滤后从5607个原始视频中筛选出2112个候选不安全视频。通过聚类和主题编码,归纳出五类不安全视频:扭曲/怪异、恐怖、色情、暴力/血腥和政治。经IRB批准,招募403名在线参与者对视频进行标注,最终确认937个不安全视频,并构建了首个VGM生成不安全视频数据集。针对现有防御方法(输入过滤或输出过滤)的不足,论文提出一种名为潜在变量防御(LVD)的新方法,该方法在模型内部采样过程的初始阶段检测不安全样本,通过分析潜在空间中的中间表示来判断是否生成不安全内容。实验表明,LVD在三个开源模型上分别达到0.99、0.92和0.91的防御准确率,且在对抗性提示和图像到视频扩散模型上准确率均超过0.90。与基线方法相比,LVD在大规模采样时可将时间和计算资源降低10倍。此外,LVD还能与其他防御方法组合使用以提升整体性能。论文将公开数据集和代码。
💡 推荐理由: 随着视频生成模型的普及,其产生不安全内容的潜在风险日益突出。该研究首次系统性地揭示了VGM的不安全生成问题,并提出了高效的内部防御机制LVD,为内容安全审核提供了新思路,值得安全从业者关注。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chong Fu 0002, Xuhong Zhang 0002, Shouling Ji, Jinyin Chen, Jingzheng Wu, Shanqing Guo, Jun Zhou 0011, Alex X. Liu, Ting Wang 0006
本文针对纵向联邦学习(VFL)中的标签推断攻击提出了一种名为KD-k(知识蒸馏结合k-匿名)的防御框架。在VFL中,多个参与方持有垂直划分的数据,共同训练机器学习模型,其中标签仅由聚合服务器(标签所有者)持有,旨在保护标签隐私。然而,已有研究发现,攻击者可以利用服务器返回给底层模型的梯度信息,结合少量辅助标签(仅需训练数据中极少部分样本的标签),推断出其他样本的私有标签。这类攻击被称为标签推断攻击,严重威胁了VFL中的标签隐私。为了抵御此类攻击,本文提出的KD-k框架结合了知识蒸馏和k-匿名技术:首先通过知识蒸馏机制,将原始教师模型的知识迁移至学生模型,从而减少梯度中关于标签信息的泄露;同时引入k-匿名,确保每一类的梯度在统计上无法区分个体样本,进一步弱化攻击者的推断能力。在多个标准数据集上进行的实验表明,应用KD-k后,多种标签推断攻击的成功率显著下降,降幅超过60%,而VFL全局模型的精度几乎不受影响(几乎无损失)。该工作为VFL中的隐私保护提供了有效的解决方案,平衡了模型效用与隐私安全性。本文适合联邦学习、隐私保护机器学习领域的研究人员和工程师阅读,以了解标签推断攻击的现状及一种实用的防御思路。
💡 推荐理由: 标签隐私是VFL中的关键安全问题,本文提出的KD-k框架能有效降低标签推断攻击成功率(>60%),同时几乎不影响模型精度,为联邦学习隐私保护提供了实用方案。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen
模型量化是降低大语言模型存储和推理开销的关键技术,但最近的研究表明,量化引入的离散化和舍入误差可被攻击者利用,构造量化条件后门攻击。在这种攻击下,恶意行为在全精度阶段保持休眠,仅在量化部署后激活,从而绕过传统的安全审计和检测机制。针对这一威胁,本文提出了一种主动的预量化防御方法 QuantGuard。该方法引入了可微的舍入控制变量,并结合了误差引导的舍入反转约束、输出分布一致性和权重距离正则化,以精细调控关键的舍入行为。关键的是,QuantGuard 仅使用少量校准数据集,且不修改现有量化算法。这种设计打破了攻击者精心构造的权重模式与量化边界之间的精确对齐,有效抑制了量化后的后门激活路径,同时保持了模型的原始功能和性能。作者在六个主流大语言模型(包括 LLaMA-3 和 Qwen2.5-Coder)上,使用三种量化精度(INT8、FP4 和 NF4),在三个代表性场景(易受攻击代码生成、内容注入和过度拒绝)下进行了系统实验。结果表明,QuantGuard 能够持续缓解量化条件后门攻击,将攻击成功率降低到与干净模型相当的水平,同时在通用能力基准测试上基本保持性能。该方法计算开销低,为安全量化部署 LLM 提供了一种有效实用的解决方案。
💡 推荐理由: 量化是LLM部署的关键技术,但量化条件后门攻击可绕过传统安全审计。本文提出的QuantGuard防御方法能在不改变量化算法的前提下有效抑制后门,为实际安全部署提供了重要保障。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nima Dorzhiev
本论文提出了RIPA,首个针对基于ROS 2的LLM控制机器人系统的多通道感知向量提示注入攻击的系统性实证研究。研究在5个不同参数量(约4B至284B)的LLM上进行了每个攻击变体100次独立实验,涵盖DeepSeek-V4-Flash、Llama-3-8B-Instruct-Lite、Llama-3.3-70B-Instruct-Turbo、Qwen 2.5-7B-Instruct-Turbo和Gemma-3n-E4B。发现模型存在特定的脆弱性轮廓,且不随参数量单调变化:例如,Llama-3.3-70B-Instruct-Turbo在所有攻击变体上达到100%攻击成功率(ASR),而Llama-3-8B-Instruct-Lite和Qwen 2.5-7B-Instruct-Turbo在直接覆盖注入上为0% ASR,最小的Gemma-3n-E4B与70B模型脆弱性相似,表明鲁棒性与模型架构相关而非规模。研究还提出了一种混合语义防火墙,对已知注入模式实现0% ASR且无假阳性,但对混淆攻击的绕过率为10.2%。进一步引入了三种感知注入通道:视觉(通过OCR)、音频(通过Whisper STT)和LiDAR传感器上下文投毒(Channel 3),其中Channel 3通过在LLM系统提示层注入虚假障碍数据,在DeepSeek-V4-Flash上实现100% ASR。此外,贡献了包含19种混淆载荷的防火墙绕过分类。所有代码、数据和结果公开。
💡 推荐理由: 该研究揭示了LLM控制机器人系统在多模态感知输入下的脆弱性,为安全从业者提供了攻击面理解和防御设计的重要参考。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Poojitha Thota, Shirin Nilizadeh
该论文针对在微调阶段对大型语言模型(LLM)进行数据投毒攻击的防御问题展开研究。在抽象文本摘要任务中,微调数据集通常较小,攻击者可通过操纵少量训练样本,使模型生成有偏见或有害的摘要,同时保持标准评估指标正常。论文提出了一种统一的防御框架,可在模型部署后检测并修复微调阶段的数据投毒。在白盒场景下,被投毒的文档-摘要对表现出异常高的训练影响,通过影响函数分析和语义一致性检查可有效检测。在黑盒场景下,被投毒模型对保持语义的扰动表现出2-3倍的敏感性,可实现无需访问训练数据的行为审计。此外,论文还引入了两种新型攻击:事实扭曲攻击和代表性偏见攻击,证明投毒可改变摘要行为而不触发常规警报。实验基于9种架构和6个基准数据集,在自适应攻击下,检测精度达到85-92%,梯度上升遗忘(unlearning)可恢复高达96%的原始行为,且ROUGE指标下降小于0.6%。研究表明,微调阶段投毒会留下持久的结构性痕迹,使得无需完全重新训练即可实现实用检测和部署后恢复。
💡 推荐理由: LLM在微调阶段面临的数据投毒风险极具隐蔽性,传统防御难以兼顾效果和效率。本文首次提出统一的后验防御方案,兼顾检测与恢复,对AI供应链安全具有重要参考价值。
🎯 建议动作: 研究跟进,考虑在内部LLM微调流水线中集成类似检测与修复机制
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gabriela F. Ciocarlie, Kathrin Grosse, Somesh Jha, Daryna Oliynyk, Andrew Paverd, Christian Wressnegger
该论文探讨了代理人工智能(Agentic AI)如何解决网络安全中长期存在的挑战。当前安全防御面临成本高昂、人工密集型任务成为瓶颈等问题,许多防御措施因效率低下而难以实施。代理AI通过直接接收和推理自然语言或代码的能力,有望自动化这些任务,从而扩大可行防御的范围。论文首先系统性地将开放的安全问题映射到新兴的代理AI能力上,随后通过16个案例研究(涵盖供应链分析、漏洞管理、事件响应等场景)具体展示了代理AI如何协助防御者。每个案例分析了传统方法的局限性、代理AI的潜在优势以及实现路径。研究贡献包括:提出了一个将安全挑战与AI能力对齐的框架;通过案例研究验证了代理AI的实用价值;指出了当前代理AI在可靠性、可解释性和安全性方面的局限性。适合安全研究人员、AI开发者和安全运营团队阅读,以了解AI agent在防御中的前沿应用。
💡 推荐理由: 该研究为安全团队提供了一种新思路:利用代理AI自动化人工密集型安全任务,可显著提升防御效率和覆盖面,尤其适用于供应链分析等复杂场景。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Yijun Yang, Ruiyuan Gao 0001, Yu Li 0007, Qiuxia Lai, Qiang Xu 0001
该论文聚焦于深度神经网络(DNN)在安全关键领域(如自动驾驶)中面临的对抗性样本威胁。现有防御方法存在诸多局限:只能防御部分对抗性样本,或导致正常输入的高精度损失,且多数无法抵御自适应攻击(即攻击者了解防御机制后针对性构造的样本)。作者观察到一种语义矛盾现象:人类对图像的感知与网络内部表征之间存在差异。基于此,提出一种新的检测方法,通过比较网络输出与人类可理解的语义标签是否一致来识别对抗性样本。具体地,该方法利用一个额外的语义一致性校验模块,该模块从网络中间层提取特征,并与输入的语义标签进行对比,若不一致则判定为对抗性样本。实验在多个基准数据集(如ImageNet、CIFAR-10)和多种攻击手段(FGSM、PGD、CW等)下进行,结果表明该方法能有效检测多种对抗性样本,同时对正常输入的精度损失极小。此外,该方法在自适应攻击下仍能保持较高检测率,展现了较好的鲁棒性。主要贡献包括:首次系统性地利用语义矛盾检测对抗性样本;提出一种轻量级、可插拔的检测模块,降低部署成本;通过大量实验验证了方法的有效性。该研究适合计算机视觉安全、DNN鲁棒性领域的研究人员及安全工程师阅读。
💡 推荐理由: 针对对抗性样本的现有防御普遍存在覆盖不全或影响正常性能的问题,该论文提出的基于语义矛盾的检测方法在保持高检测率的同时几乎不损失正常输入精度,且能抵抗自适应攻击,为实际部署提供了更实用的解决方案。
🎯 建议动作: 研究跟进:评估该方法在自身业务场景中的适用性,并考虑集成到现有防御体系中。
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Kaihsun Yang, Min-Yan Tsai, Chia-Mu Yu
该论文针对模型量化中的后门攻击(Quantization-Conditioned Backdoors, QCBs)提出了一种新型防御方法。QCBs 是一种后门威胁:模型在全精度下表现正常,但经过量化后激活恶意行为。现有防御通常需要修改量化过程或校正激活统计信息,导致额外计算开销或依赖特定量化设置。作者从参数空间角度出发,观察到全精度模型与量化模型之间的权重差异编码了一种结构化的行为偏移,这种偏移可被解释为恶意任务向量而非随机量化噪声。基于此,提出了 QVec 方法:在部署前通过受控参数修正来抵消该恶意方向。QVec 无需重训练、无需触发器样本,仅需一次量化传递来估计参数偏移,并结合轻量级超参数搜索。在图像分类基准和多种大语言模型(LLM)攻击场景上的实验表明,QVec 能在保持干净模型性能的同时持续抑制后门激活。该方法为防御 QCBs 提供了一种高效且通用的新思路。
💡 推荐理由: 模型量化广泛应用,QCBs 是一种隐蔽且危险的攻击;QVec 无需修改量化流程或重训练,即插即用,对于保护量化模型安全具有实际价值。
🎯 建议动作: 研究跟进,在内部评估 QVec 对现有量化模型的防御效果。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Meng Shen 0001, Kexin Ji, Jinhe Wu, Qi Li 0002, Xiangdong Kong, Ke Xu 0002, Liehuang Zhu
网站指纹(WF)攻击严重威胁匿名网络(如Tor)用户的隐私。尽管已有多种防御方案,但面对基于深度学习的先进WF攻击,现有防御效率不足。本文提出Palette,一种新颖且实用的实时WF防御方法,通过流量簇匿名化保护实时Tor流量。核心思想是将流量模式高度相似的网站聚类,并为每个簇(即一组相似网站)设计统一的标准化流量模式,从而阻止攻击者区分簇内相似网站,提供强匿名保证。Palette的关键步骤包括:首先,基于真实流量特征对网站进行聚类;其次,为每个簇生成一个统一的目标流量模式(例如,通过填充、调整数据包大小和时序等);然后,在流量传输过程中实时将簇内网站的流量整形为该统一模式。实验使用公开真实数据集进行综合评估,结果表明Palette在可接受的额外开销下,大幅降低了最先进WF攻击的准确率。具体地,在Tor网络中以可插拔传输(Pluggable Transport)形式实现Palette并部署后,平均将SOTA WF攻击的准确率降低73.60%,相比现有防御提升33.50%-43.47%。该方法适用于所有关注匿名通信安全的场景,尤其适合Tor网络运营商、隐私保护研究人员及安全产品开发者阅读。
💡 推荐理由: 深度学习WF攻击使Tor用户隐私面临严峻挑战,现有防御失效。Palette首次提出基于流量簇匿名化的实时防御,在保持低延迟同时大幅降低攻击准确率,为匿名网络隐私保护提供了新范式。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Po-Han Cheng, Chia-Mu Yu, Ying-Dar Lin, Yu-Sung Wu, Wei-Bin Lee
该论文提出 CodeSentinel,一种针对代码大语言模型(Code LLM)中间接提示注入攻击的三层推理时防御系统。研究背景:代码大语言模型在编程辅助中常从外部仓库、文档、问题线程和编码智能体环境检索代码上下文,攻击者可利用此过程在注释、字符串、标识符或诱饵代码中隐藏恶意指令,实现间接提示注入。核心问题:现有防御方法如输入过滤、输出检测或整体提示净化,难以同时兼顾准确性和低开销。方法:CodeSentinel 通过三层架构进行实时净化。第一层利用 Tree-sitter 解析代码的 Concret e Syntax Tree (CST),提取高风险节点(如字符串、注释等可能携带注入的节点)。第二层包括语法引导预过滤(移除明显无关节点)和 CST 引导动态 Min-K% 评分(利用语言模型对节点的困惑度差异识别异常)。第三层进行节点扰动分析,通过轻微修改节点并观察模型输出变化来确认攻击触发器。检测到的恶意节点被移除或中和后,再将纯净代码送入下游 Code LLM。实验:在六个最新攻击家族(包括对抗性和自然语言样式)上评估,CodeSentinel 实现平均节点级 F1 得分为 0.80,显著优于现有工具 CodeGarrison、DePA 和 KillBadCode。主要贡献:首次针对代码上下文的间接提示注入提出结构化防御,集成多种检测技术,具备高准确率和较低计算开销。适合读者:安全研究人员、开发安全工程师、LLM 应用开发者。
💡 推荐理由: 代码大语言模型在编程场景中广泛应用,间接提示注入可导致模型执行恶意代码或泄露敏感信息。CodeSentinel 提供了一种实用的实时防御方案,能有效净化代码上下文,降低攻击风险,对保障基于LLM的编码助手的供应链安全具有重要价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jie Fu 0003, Yuan Hong 0001, Zhili Chen, Wendy Hui Wang
图神经网络(GNN)在基于图结构的数据学习中表现出强大能力,但其广泛应用引发了严重的隐私问题。尽管已有研究主要关注边级隐私(如边是否存在),但图拓扑结构(即图的整体形状)的机密性是一个关键但未被充分探索的威胁。本文首次系统研究了GNN中的拓扑隐私风险,揭示了GNN对图级别推理攻击的脆弱性。作者提出了一套拓扑推理攻击(TIAs),攻击者仅通过黑盒访问训练好的GNN模型,就能重构目标训练图的拓扑结构。实验表明,GNN极易受到此类攻击,而现有的边级差分隐私机制要么无法缓解风险,要么严重损害模型精度。为此,本文提出私有图重构(PGR)防御框架:将其建模为双层优化问题,通过元梯度迭代生成合成训练图,同时基于演化的图更新GNN模型。大量实验证明,PGR在最小化模型精度损失的同时,显著降低了拓扑泄露。代码与完整论文已开源。
💡 推荐理由: 首次系统性揭示GNN的拓扑隐私漏洞,挑战了边级隐私保护充分的假设;提出的攻击和防御方法对隐私敏感图应用(如社交网络、生物信息)具有直接指导意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lipeng He, Yihan Wang, Jiawen Zhang, N. Asokan
本文针对LLM智能体面临的间接提示注入攻击(攻击者通过第三方数据嵌入恶意指令)提出了一种新的防御方法RETA。现有防御方法在静态基准测试中近乎零攻击成功率,但在自适应攻击评估中性能大幅下降。作者分析指出两大失效原因:一是现有防御仅识别特定攻击模式,而非判断指令意图是否与用户任务相关;二是基于训练的防御方法其对抗样本仅来自少量手工模板,导致泛化能力差。RETA方法将防御决策建立在用户任务之上,而非攻击者的数据。在每个工具输出步骤,防御者通过链式思维推理验证其行为是否与用户任务一致。通过红队模拟,攻击者合成对抗训练数据,并利用字典学习多样性奖励覆盖广泛的注入变体策略。最后通过多目标强化学习优化防御者,实现更好的安全-效用平衡。在6种黑盒自适应攻击下,RETA将每个攻击的攻击成功率(ASR)控制在10%以下,平均ASR分别为2.92%和3.75%,同时保持攻击下和干净输入下的高效用。本文适合LLM安全研究者、智能体系统开发者以及关注提示注入防御的安全工程师阅读。
💡 推荐理由: 提示注入是LLM智能体面临的核心威胁,现有防御在自适应攻击下全面失效。RETA提出基于任务对齐的方法,首次在自适应评估中保持低至3%的攻击成功率,为实际防御部署提供了可行方案。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zixuan Gu, Xiaojun Ye, Yang Liu
该研究聚焦于分割式大语言模型(Split-LLM)中的数据泄露与防御问题。在隐私敏感场景中,用户面临两难:使用外部API可能泄露隐私数据,而本地部署则计算成本高昂。分割学习(Split Learning)作为一种折中方案,将模型切分,客户端运行部分网络层,服务器端运行其余部分,但这也引入了新的隐私风险。以往工作主要关注输入提示(prompt)的泄露,通常通过对中间表示的逆向攻击实现,而对生成响应(response)中潜在敏感信息泄露的关注较少。本文首先揭示了Split-LLM中的新型漏洞,提出了补丁模型逆向攻击与双端初始化(PIDI),这是一种两阶段攻击方法,同时针对私有输入提示和输出响应。PIDI结合双端初始化和补丁逆向策略来处理长序列,显著优于以往的逆向方法。为抵御来自两端的威胁,作者进一步提出了基于适配器的双端防护与互信息防御(ADMI),它集成了适配器本地预热策略和互信息正则化,在最小影响任务性能的前提下提供了强大的经验隐私保护。在多种任务和模型上的大量实验表明,ADMI能有效防御PIDI及其他最新逆向攻击。该工作揭示了Split-LLM中双向数据泄露的风险,并提出了实用的防御方案,对安全部署大语言模型具有重要参考价值。
💡 推荐理由: 该研究首次系统性揭示分割式大语言模型(Split-LLM)中双向(输入提示与输出响应)数据泄露风险,并提出了有效防御方法,对保护用户隐私、指导LLM安全部署具有直接价值。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shinan Liu, Xiang Cheng, Hanchao Yang, Yuanchao Shu, Xiaoran Weng, Ping Guo 0007, Kexiong Curtis Zeng, Gang Wang 0011, Yaling Yang
该论文提出了一种基于恒星观测的GPS欺骗攻击防御方法,利用现成的GPS芯片和可见光传感器(例如摄像头)检测定位信号的一致性。传统GPS欺骗攻击通过伪造卫星信号使接收机产生错误定位,而本文方法通过比对GPS报告的定位与基于恒星位置的天文观测结果来识别欺骗。恒星位置是固定且难以伪造的,因此任何与恒星位置不一致的GPS定位都将被标记为潜在攻击。作者使用现成的GPS接收机和商用相机实现原型系统,实验表明该方法能够有效检测多种类型的GPS欺骗攻击,且误报率低。该研究为GPS安全提供了一种低成本、易部署的补充防护手段。
💡 推荐理由: GPS欺骗攻击对自动驾驶、无人机、海运等关键基础设施构成严重威胁,现有防御方案多依赖专用硬件或网络辅助,成本高。本文利用常见硬件(相机+GPS芯片)提供了一种新颖、低成本的检测思路。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Pengrun Huang, Chhavi Yadav, Ruihan Wu, Kamalika Chaudhuri
本文研究了大型语言模型(LLM)在领域特定数据集上微调时面临的数据集属性泄露风险。近期研究表明,通过属性推断攻击(property inference attacks),攻击者能够有效提取模型训练数据集中的敏感属性(如数据集的整体分布特征),从而构成保密性威胁。现有防御方法主要依赖于修改训练数据分布,这需要访问原始数据并重新训练模型,限制了其在数据不可用或模型已部署场景下的适用性。本文提出基于对齐(alignment)的防御方法,通过后训练对齐(post-training alignment)重塑模型输出分布,使其朝向目标属性比例,而无需修改训练数据或重新训练。具体地,作者将两种广泛使用的基于人类反馈的强化学习(RLHF)框架——直接偏好优化(DPO)和组相对策略优化(GRPO)——适配为防御方法:DPO通过构造偏好对(将属性比例正确的输出作为偏好样本),GRPO通过定义特定奖励函数来惩罚属性泄露。综合实验表明,基于对齐的防御能有效缓解属性推断攻击,同时在模型效用与隐私保护之间取得良好平衡。本文的主要贡献在于首次将对齐技术应用于防御属性推断攻击,提供了无需数据访问的轻量级解决方案,对保护微调数据的隐私具有重要实践意义。适合关注LLM隐私保护、对抗性攻击防御的研究人员和工程师阅读。
💡 推荐理由: 为LLM微调场景下的数据集属性泄露问题提供了一种无需重新训练、无需原始数据即可部署的防御方案,填补了现有防御在数据不可用时的空白。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Sheng Wan, Dashan Gao, Hanlin Gu, Lixin Fan, Daning Hu, Qiang Yang
该论文首次系统性地研究了基于logit的联邦学习(FL)中隐藏的隐私风险。传统的参数化FL通过交换模型权重或梯度来保护数据隐私,而新兴的logit-based FL方法则在公共数据上共享模型输出(logits),从而促进模型异构性、降低通信开销并增强客户隐私。然而,这些方法的隐私风险被严重忽视。本文提出并分析了一种半诚实服务器(对手)通过学习训练过程中的历史logits来窃取客户私有模型的自适应模型窃取攻击(AdaMSA)。作者从理论和实验两方面证明了这一隐私风险的存在,即使在公共数据与私有数据无关的情况下,风险依然存在。为应对这一威胁,他们提出了一种简单而有效的防御策略:在传输logits时添加扰动,方向是使隐私风险最小化同时最大限度保持训练性能。实验结果表明,AdaMSA能够有效窃取模型,而防御策略能在少量影响性能的前提下显著降低隐私泄露。该研究为logit-based FL的安全性提供了重要理论基础和实用解决方案,并提醒社区注意这一被忽视的隐私漏洞。
💡 推荐理由: 联邦学习是保护数据隐私的关键技术,logit-based方法因其优势被广泛采用,但其隐私风险尚未被充分认识。本研究揭示了即使公共数据无关,攻击者仍能窃取私有模型,并提供了可落地的防御方案,对使用logit-based FL的企业和研究机构具有高度警示意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Abu Taib Mohammed Shahjahan, Mohammad Mannan, Abdessamad Ben Hamza, Amr Youssef
该论文聚焦于深度伪造图像检测器在对抗攻击下的鲁棒性问题。尽管近年来提升检测器对未见生成模型泛化能力的研究取得进展,但检测器仍易受对抗样本攻击。作者复现了Abdullah等人(IEEE SP 2024)对八种检测器的评估,并额外测试了七种最先进检测器,均发现攻击下性能显著下降。为此,论文提出一个不依赖对抗训练的统一框架,融合三种互补设计:1)基于离散余弦变换(DCT)的四阶矩池化,在频域建立高阶统计建模;2)从噪声残差中提取内容无关特征;3)通过分块语义破坏实现跨场景泛化。核心洞察是对抗攻击主要利用低阶统计和视觉语义,而高阶残差-频率特征(尤其是峰度)几乎不受约束。大量实验表明,该方法在六种不同架构的检测器上持续提升鲁棒性,在现有对抗基准测试中将召回率退化降低最多88.9%,并将最佳检测器(Yang等人,IEEE CVPR 2025)的攻击下准确率从81.9%提升至97.15%。该工作为提升深度伪造检测对抗鲁棒性提供了通用的、架构无关的解决思路。
💡 推荐理由: 深度伪造检测器在对抗攻击下脆弱性是实际部署的关键隐患;该方法无需对抗训练即可显著提升鲁棒性,对蓝队构建可靠检测体系具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hiskias Dingeto, William Leeney
该论文提出了AgentRedBench,一个动态的LLM驱动的红队基准测试,专门针对通过SaaS集成(如Gmail、Salesforce、Jira等)使用工具调用的LLM智能体面临的间接提示注入威胁。现有基准测试覆盖的集成种类有限,且攻击载荷重复使用;开源防御模型多基于聊天数据训练,而非工具响应内容。AgentRedBench包含215个微妙的未授权场景,涵盖9个功能家族、24个企业集成和5种攻击类型。对八个模型(Anthropic、OpenAI、Google)的评估显示,无防御时的攻击成功率(ASR)介于32%(Claude Sonnet 4.6)到81%(Gemini 3 Flash)之间。为了保持场景集不进入训练语料并确保ASR的时效性,作者开源了代码、集成模式和AgentRedGuard模型;规范场景通过维护者中介渠道进行版本管理。AgentRedGuard是一个基于多样化的集成对抗工具响应内容训练的防御模型,将面板ASR从69.9%降至2.4%,误报率仅为0.37%,在检测率和误报率两方面均优于所有开源基线(如Llama Guard、PromptGuard 2、ProtectAI)。跨集成和跨攻击类型的保留测试证实了性能迁移能力。
💡 推荐理由: LLM智能体在真实生产环境中面临间接提示注入的严重威胁,现有基准和防御不足。AgentRedBench提供了更全面的评估框架,AgentRedGuard实现了极低误报率下的高效检测,对保护企业SaaS集成场景有直接价值。
🎯 建议动作: 研究跟进并评估将AgentRedGuard集成到内部LLM智能体防护流程中
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Guoming Zhang, Xiaoyu Ji 0001, Xinfeng Li, Gang Qu 0001, Wenyuan Xu 0001
本文关注针对语音助手的 DolphinAttack(不可听语音命令攻击),该攻击将可听语音调制到超声波上,从而无声地注入恶意命令,例如控制智能门锁或音箱。由于攻击利用了超声波的人耳不可听特性,且不需要物理接触,传统方法难以防御。现有防御方案通常需要修改麦克风硬件,成本高且兼容性差。为此,作者提出 EarArray,一种轻量级的软件防御方法,无需额外硬件或硬件改动,仅利用智能设备上已有的多个麦克风阵列。其核心原理是:超声波在空气中传播时衰减速度比可听声更快,因此通过分析多个麦克风接收到的信号衰减率,可以区分正常可听声命令和调制的不可听命令。同时,基于信号到达不同麦克风的时间差和能量差异,EarArray 还能估计攻击者的方向。作者建立了声音传播模型,并在两个特制的麦克风阵列上实现了原型系统。实验结果表明,EarArray 检测不可听语音命令的准确率达到 99%,攻击方向识别准确率达到 97.89%。该工作为抵御超声波类隐蔽攻击提供了实用、低成本的解决方案,尤其适合集成在现有智能音箱、手机等设备中。
💡 推荐理由: DolphinAttack 对各类语音助手构成严重威胁,而 EarArray 仅通过软件算法即可高精度检测和定位攻击,无需硬件修改,具有高实用价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Huanli Gong, Zhipeng Wei, Yu Fu, Haz Sameen Shahgir, Ananya Gupta, Yue Dong, N. Benjamin Erichson
多轮越狱攻击(Multi-turn Jailbreak Attacks)利用辅助评判模型(Judge Model)的反馈信号来迭代优化对抗性提示,逐步突破大语言模型(LLM)的安全防护。现有防御措施主要针对单轮响应或最终输出进行检测与阻断,但未能切断攻击者利用中间交互获取评判信息的闭环,导致攻击者仍能从辅助模型的反馈中提炼出提示改进方向。本文提出 D-Judge——一种语义保持的输出重写防御方法。D-Judge 在受害者 LLM 的响应被攻击者的评判模型评估之前,直接干预该循环,对响应进行重写。重写后的响应在语义上与原始响应等价,但能使评判模型给出不同的有害性分数,从而扭曲攻击者的反馈信号。攻击者的提示优化过程随后会针对一个失真的攻击进度信号进行,使得后续查询偏离有效路径。为提升 D-Judge 生成此类重写的能力,研究者构建了一个包含语义等价但评判分数不同的响应配对数据集,并采用监督微调(Supervised Fine-Tuning)后接直接偏好优化(Direct Preference Optimization)进行训练。在 HarmBench 基准上的实验表明,D-Judge 在保持良性任务性能的同时,显著降低了当前最先进多轮越狱攻击的成功率。该方法主要贡献在于:(1) 提出一种新的防御视角——中断攻击者的反馈闭环而非仅检测有害内容;(2) 设计了语义保持的重写机制以保持可用性;(3) 展示了通过偏好优化训练重写模型的有效性。适合关注 LLM 安全防御、对抗性攻击与防御的研究者和安全工程师阅读。
💡 推荐理由: 多轮越狱攻击是当前 LLM 安全的主要威胁之一,D-Judge 首次提出通过破坏攻击者反馈循环来进行主动防御,极具创新性,且实验证明了其有效性,为安全从业者提供了新的防御思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie
本文针对提示注入攻击的防御问题,指出现有检测器存在异质性:每个检测器在不同攻击类型上表现各异,没有单一检测器始终可靠。然而,现有系统仍采用固定单检测器流水线,将每个请求都交给同一个检测器处理,从而暴露于其盲区。作者提出将防御重新定义为检测器分配问题:给定一个异构检测器池,针对每个请求决定运行哪些检测器,以及是否升级到LLM法官。为此,他们提出了SCOUT(Scalable and Controllable Outcome-prediction for Uncertainty-aware Triage)框架,通过预测每个检测器在类似历史输入上的样本级可靠性和延迟,实现动态分配决策,并向外暴露一个安全-效用阈值供操作员调节(效用包括良性通过率和墙钟时间)。为了评估该设置,他们构建了SCOUT-450基准,该基准包含了结构复杂、面向代理的注入攻击,这些攻击在旧的提示注入数据集中代表性不足。在SCOUT-450上,与始终启用GPT-4o法官相比,安全导向的工作点将攻击成功率降低46%,总墙钟时间减少40%,而良性效用仅下降5.1个百分点。SCOUT还能迁移到三个外部基准(BIPIA、IPI、IHEval),改进了安全-效用前沿。
💡 推荐理由: 该工作提出了一个新颖的防御范式,通过预测性检测器分配替代固定流水线,显著提升安全性与效率,尤其适用于需要多步骤推理的Agent场景。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Nima Dorzhiev, Peng Liu
本文针对大型语言模型(LLM)智能体面临的提示注入攻击,提出了一种增强的多态提示组装(PPA)防御方法。原始的PPA通过从固定池中随机选择分隔符对来隔离用户输入与系统指令,但存在静态池复用导致的“爆炸半径”漏洞:一旦某个分隔符泄露,可在后续请求中被利用。作者提出动态、按请求生成分隔符的方法,利用基于时间戳、会话标识符和加密随机数的域分隔SHA-256摘要,为每个组装提示生成唯一的(BEGIN, END)金丝雀对,从而将泄露暴露限制在单个请求内。在Llama-3.3-70B-Instruct-Turbo模型上针对16种注入载荷进行评估,并在DeepSeek-V4-Flash模型上进行跨模型验证。针对M1混淆载荷(leet speak加紧迫性),动态模式将攻击成功率(ASR)从0.88降至0.38,实现2.3倍的缓解效果,且95% Wilson置信区间无重叠,具有统计显著性。针对format_breakout_salad攻击,静态模式下的分隔符泄露率(0.467)在动态模式下完全消除(0.000),证实了爆炸半径的减小。该实现无需模型微调,每个请求仅增加2.7微秒的提示组装开销,且向后兼容现有PPA SDK。该研究为LLM智能体安全提供了实用、高效的防御增强方案。
💡 推荐理由: 提示注入攻击是LLM应用的核心威胁,本文提出的动态分隔符生成方法在不牺牲性能的前提下显著降低攻击成功率,并消除静态池复用漏洞,对部署LLM智能体的团队具有直接防御价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yinyuan Zhang, Cuiying Gao, Yueming Wu 0001, Shihan Dou, Cong Wu 0003, Ying Zhang 0066, Wei Yuan 0001, Yang Liu 0003
本文提出了一种名为“Fighting Fire with Fire”的连续攻击方法,用于对抗Android恶意软件检测系统。研究背景是当前Android恶意软件检测模型容易受到对抗样本攻击,而现有的防御方法往往被动且效果有限。核心问题是如何主动且持续地生成对抗样本以训练更鲁棒的检测模型。方法上,作者设计了一种迭代攻击框架,能够在检测模型不断更新的过程中持续生成高效对抗样本,形成攻击与防御的博弈。实验表明,该方法能显著降低多种主流检测模型(如Drebin、MalDozer)的准确率,并证明通过这种连续攻击训练出的模型在对抗性上比传统对抗训练更具鲁棒性。主要贡献包括:1) 首次提出连续攻击范式;2) 揭示了静态对抗训练的局限性;3) 提供了一种新的评估检测模型鲁棒性的方法。适合安全研究人员及Android安全工程师阅读。
💡 推荐理由: 对抗攻击是安全模型部署的主要威胁,本文提出的连续攻击方法能帮助蓝队更真实地评估和增强检测模型的鲁棒性,具有直接防御价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yilan Gao, Sida Huang, Hongyuan Zhang, Xuelong Li
本文针对文本到图像生成模型(如 Stable Diffusion)在作为云端 API 服务部署时面临的模型窃取攻击展开研究。攻击者可以通过反复查询 API 收集大量生成的合成图像,并用这些图像训练私有替代模型,从而实现未经授权的知识蒸馏和能力复制,而无需访问原始模型权重。现有防御方法难以在保持输出图像视觉质量、提供显式扰动幅度控制以及高效处理大规模输出之间取得平衡。为此,作者提出了一种基于单次生成器(single-pass)的保护框架 WaveGuard。WaveGuard 采用频率感知的扰动生成器,在用户指定的扰动预算下对每张合成图像注入结构化、不可感知的扰动。这些扰动对于正常观看者几乎不可见,但能显著降低受保护图像作为训练数据对未授权学生模型的有效性。在 WikiArt 数据集上的合成输出蒸馏实验表明,WaveGuard 在有效性、保真度和效率三者之间取得了良好权衡,实现了显式的不可感知性控制,并大幅提升了保护效率。该方法不需要修改原始生成模型,仅需在输出图像上叠加扰动,可无缝集成到现有 API 管道中。
💡 推荐理由: 随着生成式AI服务商业化,模型窃取成为重大安全威胁。本文提出一种实用、高效的防御方案,在不影响用户体验的前提下干扰攻击者训练替代模型,对保护商业模型知识产权具有直接价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yasmine Hayder
知识图谱(KG)作为链接数据的强大表示,具有灵活性、语义丰富性,并支持知识丰富化和推理,帮助数据所有者组织和利用异构数据提供个性化服务。然而,真实世界的知识图谱往往不完整,隐藏了真实事实或缺失有价值信息。知识图谱嵌入(KGE)技术常用于推断缺失信息,但基于KGE的推理可能无意中暴露敏感用户属性,即使此类数据未显式存储。本文研究了KGE推理带来的隐私风险,重点关注属性推断攻击:攻击者试图从看似非敏感的输出中推断用户敏感属性。我们提出并评估了一个框架,通过对KGE输出应用后处理消毒技术来缓解这些隐私风险。初步结果表明,此类攻击对KGE模型输出有效,并探索了采用随机化方法时推荐质量与隐私保护之间的权衡,突出了未来需要尝试更先进技术以解决该问题的必要性。
💡 推荐理由: 揭示知识图谱嵌入在推理过程中可能泄露用户敏感属性的隐私风险,为防御方设计隐私保护机制提供依据。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Jiahe Guo, Xiangran Guo, Jiaxuan Chen, Weixiang Zhao, Yanyan Zhao, Yutai Hou, Qianchao Wang, Dandan Tu, Bing Qin
多模态大语言模型(MLLM)在文本模态中学习到的安全能力往往无法泛化到语义等价的非文本输入(如图像、视频),导致持续的多模态安全差距。本文从表示几何的角度研究这一现象,通过分析文本对齐的拒绝方向(refusal direction)和模态引起的漂移方向(drift direction),发现多模态输入会压缩沿拒绝方向的可分离性,使得该方向不再可靠地识别和拒绝有害输入,作者将此失效模式命名为“安全几何崩溃”(Safety Geometry Collapse)。为了量化该崩溃,论文提出了条件拒绝可分离性(conditional refusal separability)指标,并证明模态漂移越强,拒绝可分离性越弱,攻击成功率越高。通过固定强度的激活干预实验,作者验证了模态漂移的因果作用:沿估计的漂移方向反向干预可以恢复拒绝可分离性并提升多模态安全性。有趣的是,在漂移校正后,模型展现出自我纠正(self-rectification)现象,即在前向传播过程中自动恢复识别和拒绝有害多模态输入的能力,该效应还提供了模型对输入危害程度的内部信号。基于这一信号,作者提出ReGap(Rectify Gap),一种无需训练的推理时自适应漂移校正方法。在多个多模态安全基准和实用基准上的实验表明,ReGap能够显著提升MLLM的安全性,且不损害通用能力。该研究揭示了表示级别的模态对齐对于实时安全改进和构建更安全可靠MLLM的关键作用。
💡 推荐理由: 首次从表示几何角度揭示多模态安全差距的根本原因,并提出无需重训练的推理时防御方法,对当前多模态大模型的安全部署具有直接参考价值。
🎯 建议动作: 研究跟进:建议安全研究团队复现论文核心实验,评估ReGap在自有场景下的有效性,并探索其与现有安全对齐技术的结合
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinseob Jeong, Dongkwan Kim 0001, Joon-Ha Jang, Juhwan Noh, Changhun Song, Yongdae Kim
该论文针对无人机系统面临的新型声学注入攻击进行了系统性研究,旨在揭示此类攻击的根本原理并设计相应的恢复机制。作者首先分析了无人机的惯性测量单元(IMU)在受到声波干扰时可能产生的异常输出,这种干扰可导致无人机姿态估计错误,进而影响飞行稳定性。通过建立声学注入的物理模型,论文明确了攻击频率、振幅与IMU误读之间的数学关系。在此基础上,提出了一种基于多传感器融合和异常检测的恢复方法,该方法利用加速度计与陀螺仪的冗余特性,在检测到声学干扰后动态调整传感器权重,并采用卡尔曼滤波对姿态进行修正。实验在多种商用无人机平台上进行,表明该方法能在不同声学攻击场景下有效恢复姿态估计精度,将飞行偏差降低80%以上。该研究不仅深化了对声学侧信道攻击的理解,还为构建鲁棒的无人机控制系统提供了实用策略。
💡 推荐理由: 无人机在物流、巡检等场景日益普及,声学注入攻击可低成本干扰其飞行安全。本文提供了攻击原理分析与可落地的检测恢复方法,对防御方提升无人机抗干扰能力有重要参考价值。
🎯 建议动作: 研究跟进,评估该方法在自有无人机平台上的适用性。
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yingjie Zhang, Tong Liu 0027, Zhe Zhao 0007, Guozhu Meng, Kai Chen 0012
该论文研究了大型语言模型(LLM)在面对越狱攻击时的脆弱性,发现了一个关键问题:在响应生成过程中,LLM区分安全与有害输出的能力会逐渐下降。实验表明,随着生成的进行,安全响应和有害响应的隐藏状态之间的可分离性不断减弱,这种“判别性消失”迫使模型在生成早期就做出合规性判断,从而限制了其识别逐渐形成的恶意意图的能力,导致安全微调方法在平衡安全性与实用性时失效,并无法察觉隐藏恶意。为了解决这一问题,论文提出了DEEPALIGN防御框架,通过在响应生成的中间点应用对比隐藏状态引导(contrastive hidden-state steering),增强有害与良性隐藏状态之间的分离,从而在整个生成过程中实现持续的内在毒性检测与干预。在多种不同架构和规模的LLM上的实验表明,DEEPALIGN能够将9种不同越狱攻击的成功率降至接近零或最低,同时保持模型能力并减少过度拒绝。配备DEEPALIGN的模型在拒绝具有挑战性的良性查询时错误率降低高达3.5%,标准任务性能下降不到1%,实现了安全-效用帕累托前沿的重大进步。
💡 推荐理由: 该研究揭示了LLM安全微调的根本缺陷,即生成过程中判别能力的消失,并提供了可落地的防御框架DEEPALIGN,显著提升安全-效用平衡,对AI安全领域具有重要启发。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Licheng Pan, Yunsheng Lu, Jiexi Liu 0005, Jialing Tao, Haozhe Feng, Hui Xue 0001, Zhixuan Chu, Kui Ren 0001
本文针对大语言模型(LLM)的“越狱”攻击机制展开因果分析研究。现有研究主要通过对潜在表示的探测来分析越狱提示,但往往忽略了可解释提示特征与越狱发生之间的因果关系。为此,作者提出了Causal Analyst框架,将LLM集成到数据驱动的因果发现中,以识别越狱的直接原因,并将其分别用于攻击与防御。该框架首先构建了一个包含35k次越狱尝试的数据集,涵盖7个LLM、100个攻击模板和50个有害查询,并人工标注了37个可读的提示特征。随后,通过联合训练基于LLM的提示编码和基于图神经网络的因果图学习,重建了从提示特征到越狱响应的因果通路。分析发现,“正面角色”(Positive Character)和“任务步骤数”(Number of Task Steps)等特定特征是越狱的直接因果驱动因素。基于这些因果洞察,作者开发了两个应用:一是“越狱增强器”,通过针对性地增强因果特征显著提升了在公开基准上的攻击成功率;二是“护栏顾问”,利用学到的因果图从混淆查询中提取真正的恶意意图。大量实验包括基线对比和因果结构验证证实了因果分析的鲁棒性,并证明其优于非因果方法。本文表明,从因果角度分析越狱特征是提升LLM可靠性的有效且可解释的途径。代码已开源。
💡 推荐理由: 首次从因果视角系统性地揭示LLM越狱的驱动机理,不仅解释了现有攻击为何成功,更提供了可操作的防御思路,有助于构建更鲁棒的护栏机制。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Liwei Zhang, Linghui Li, Xiaotian Si, Ziduo Guo, Xingwu Wang, Kaiguo Yuan, Bingyu Li
本文针对联邦学习中的成员推断攻击提出了一种统一的防御框架。成员推断攻击旨在判断某个特定数据样本是否被用于训练模型,严重威胁用户隐私。现有防御方法存在计算开销大或可用性-隐私权衡不佳的问题。作者提出通过知识蒸馏和贡献感知聚合来协同防御:首先,服务器利用全局模型对客户端更新进行蒸馏,生成软标签指导本地训练,减少过拟合从而降低成员推断风险;其次,引入贡献感知聚合机制,根据客户端数据质量动态调整聚合权重,使聚合器对异常更新更鲁棒。实验在多个基准数据集(如CIFAR-10、MNIST)上验证,结果表明该方法在保持模型可用性的同时,显著降低了成员推断攻击的成功率(AUC下降超过10%),且计算开销低于现有对抗训练方法。该框架无需修改客户端训练过程,易于部署。
💡 推荐理由: 联邦学习中的成员推断攻击是重大隐私威胁,本工作提供了一种实用且高效的统一防御方案,对隐私合规要求高的场景(如医疗、金融)有直接应用价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Chenxiang Luo, David K. Y. Yau, Qun Song 0001
联邦学习(FL)允许多个客户端协同训练模型而不共享原始数据,但面临梯度反转攻击(GIA)的威胁,攻击者可从共享梯度中重建私有数据。现有防御方法要么在嵌入式平台上计算开销过高,要么无法同时保证隐私保护和模型效用,且许多方法易被了解防御细节的自适应攻击者绕过。为此,本文提出SVDefense,一种基于截断奇异值分解(SVD)的梯度混淆防御框架。SVDefense包含三项关键创新:1)自适应能量阈值(Self-Adaptive Energy Threshold),根据客户端脆弱性动态调整SVD截断阈值;2)通道级加权近似(Channel-Wise Weighted Approximation),有选择地保留关键梯度信息以维持模型训练效果,同时增强隐私保护;3)层级加权聚合(Layer-Wise Weighted Aggregation),在类别不平衡下实现有效的模型聚合。实验评估在图像分类、人类活动识别和关键词识别等多个应用上表明,SVDefense在提供强大隐私保护的同时对模型精度影响极小,且可在多种资源受限的嵌入式平台上实际部署。论文若被接收将公开代码。
💡 推荐理由: 联邦学习隐私保护是当前安全热点,SVDefense在资源受限设备上实现了高效抗梯度反转攻击的防御,且对模型精度影响小,为实际FL部署提供了实用方案。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinyu Tang 0003, Saeed Mahloujifar, Liwei Song, Virat Shejwalkar, Milad Nasr, Amir Houmansadr, Prateek Mittal
本文针对机器学习模型中的成员推断攻击(Membership Inference Attacks)提出一种名为SELENA的隐私保护训练框架。成员推断攻击旨在通过模型对成员与非成员输入的差异行为推断某样本是否属于训练集,是衡量模型隐私泄露的关键指标。现有防御方法如差分隐私虽能提供可证隐私保障,但会显著降低模型效用。本文的目标是在保持模型效用(utility)的同时提高成员隐私,即实现经验性隐私保障。SELENA框架包含两大核心组件:第一,Split-AI集成架构,它将训练数据随机划分为多个子集,并在每个子集上独立训练模型;在推理阶段,对于每个输入样本,仅聚合那些训练数据中不含该样本的模型输出,从而阻断攻击者利用模型行为差异。作者证明Split-AI能防御一大类成员推断攻击,但仍可能受到自适应攻击。因此,第二组件采用自蒸馏(Self-Distillation)方法,通过Split-AI集成对训练数据集进行自蒸馏,无需外部公共数据集,进一步增强对更强攻击的鲁棒性。在多个基准数据集上的实验表明,SELENA在成员隐私与效用之间实现了优于现有技术的权衡。本文适合机器学习安全研究人员、隐私保护从业者以及关注模型隐私泄露的工程师阅读。
💡 推荐理由: 成员推断攻击是评估机器学习模型隐私风险的核心方法,SELENA在保持模型高性能的同时显著提升隐私,为实际部署提供实用方案。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)