👥 作者: Roshan Sood, Onat Gungor, Tajana Rosing
大型语言模型(LLM)面临提示注入攻击的严重威胁,攻击者通过在用户输入或外部内容中嵌入恶意指令,操纵模型行为并绕过安全机制。现有防御方法大多为静态设计,依赖固定的对齐目标或针对特定攻击的过滤机制,当新攻击策略出现时需重新设计,难以应对不断演变的威胁。尽管近期提出的终身对齐方法能够适应变化的用户偏好,却未能考虑自适应攻击者会持续利用此前防御的弱点进行进化。这一缺陷在真实部署中尤为关键,因为攻击分布不断变化,要求防御系统在保持对已见攻击鲁棒性的同时持续适应。为此,本文提出COPA(持续偏好优化框架),将提示注入防御视为终身学习问题。与一次性对齐不同,COPA通过基于GRPO的优化增量整合新观察到攻击的反馈,并利用边际加权经验回放保留对先前攻击类别的防御能力。该方法能够持续适应新兴威胁,同时缓解灾难性遗忘并保持模型通用能力。在持续提示注入攻击流实验中,COPA相比最先进的防御方法平均将攻击成功率降低最高6.3倍、平均4.4倍。这些结果凸显了持续偏好优化作为防御自适应攻击者的有效范式。核心贡献包括:首次将提示注入防御形式化为持续学习问题;提出基于GRPO和边际加权经验回放的持续优化算法;在多种攻击流上验证了框架的有效性。适合LLM安全研究、AI红队和防御工程师阅读。
💡 推荐理由: 现实世界的LLM应用正面临不断进化的提示注入攻击,静态防御很快失效。COPA展示了防御系统如何通过持续学习保持长期有效性,为AI安全运营提供新思路,值得安全团队关注。
🎯 建议动作: 研究跟进,评估COPA在自身LLM应用中的适用性,考虑纳入内部防御体系测试。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Kai Li, Jong-Ik Park, Carlee Joe-Wong, Wei Ni, Falko Dressler
本文提出了一种名为 FedLNS(Federated Learning with Normalization Signatures)的服务器端框架,用于缓解联邦学习(FL)中大型语言模型(LLM)面临的恶意更新攻击问题。在联邦训练中,服务器无法直接验证每个客户端本地训练过程的正确性,恶意客户端可能通过训练于污染数据、引入错误的上下文-令牌关联,或反复提交恶意更新来使全局模型性能退化,同时增加不可靠或幻觉生成的风险。FedLNS 的核心思路是:服务器从客户端返回的局部模型中提取可训练归一化层(LayerNorm)参数的变化作为“签名”,并基于历史感知的跨客户端参考模型对这些签名进行鲁棒筛选,从而识别并剔除可疑更新。该方法的优势在于:签名完全在服务器端从已接收的模型参数中计算,无需客户端额外传输任何参数或元数据,与标准联邦学习通信开销一致;同时不依赖原始客户端数据、可信服务器数据集、标注攻击样本或单独训练检测器。筛选后,保留的完整模型更新可以继续使用标准联邦聚合规则或兼容的聚合方法。实验在 200 个客户端的设置下,对 GPT 风格、BERT 风格和 LLaMA 风格的模型从头训练,并在 40% 的总体目标篡改比例下,分别对 IID 和非 IID 数据分布进行了测试。结果表明,FedLNS 在三种架构、两种数据分布下均取得了比六种基线方法中最佳者更低的测试困惑度(perplexity),验证了其有效性和泛化能力。本文适合研究联邦学习安全、模型中毒防御、以及 LLM 鲁棒性的研究人员和工程师阅读。
💡 推荐理由: 联邦学习中的恶意客户端攻击是 LLM 实际部署中的关键威胁,FedLNS 提供了一种轻量、无需额外通信的服务器端防御思路,对构建可信的分布式 LLM 训练体系具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chang Liu, Yuni Lai, Mingyue Cui, Cong Tian, Yunyan Zhang, Xian Wu, Kai Zhou, Bin Xiao
多模态检索增强生成(M-RAG)系统正面临一类对抗性攻击:攻击者精心构造恶意数据,使其嵌入向量在向量空间中与良性条目对齐,从而欺骗检索器、诱导模型产生有害输出。现有防御大多在查询阶段运行,依赖辅助检测器、相似度重排序或特征一致性校验,但存在推理开销大、对未见攻击泛化差、且常假设特定攻击分布等缺陷。为此,本文提出 DSPrompt(Dynamic Soft Prompt)防御框架,直接重塑检索器的嵌入语义而不修改检索流程。该方法在冻结的检索器视觉和文本编码器的每一层插入少量可学习软提示,并采用由浅入深的自适应长度调度,以匹配各模型层的容量。软提示通过动态最小-最大博弈训练:一个在线多模态攻击者持续针对当前检索器构造困难对抗文档,而防御者更新参数使这类文档被挤出 top-k 检索结果,同时保留良性证据的排序与多样性。由于防御后的编码器可像标准密集检索一样预计算并建立索引,DSPrompt 无需任何额外逐查询优化,且新增参数少于 1%。在四个基准数据集和三种代表性投毒攻击上的大量实验表明,DSPrompt 显著降低了攻击成功率和投毒检索率,同时保持近乎无损的检索效用和生成保真度,在仅需基线一小部分计算成本的情况下持续优于现有防御方案。
💡 推荐理由: 多模态 RAG 正成为关键应用,但其检索环节易被嵌入投毒攻击。DSPrompt 提供了一种无额外查询开销、参数高效且可预计算的防御思路,对构建鲁棒 RAG 系统有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shuaifan Jin, He Wang 0005, Zhibo Wang 0001, Feng Xiao, Jiahui Hu 0001, Yuan He, Wenwen Zhang, Zhongjie Ba, Weijie Fang, Shuhong Yuan, Kui Ren 0001
本文提出了一种名为 FaceObfuscator 的新型人脸图像混淆方法,旨在防御基于深度学习的隐私攻击。随着人脸识别技术被广泛应用于身份认证和公共安全,人脸图像中包含的丰富生物特征也面临着被恶意模型窃取的风险。现有的人脸脱敏方法通常依靠像素级扰动或对抗扰动来保护原始身份,但这些方法要么会显著损害图像的可用性,要么在新的攻击模型面前鲁棒性不足。FaceObfuscator 的核心思路是生成一种对人脸识别特征提取过程具有梯度下降抵抗性的混淆特征,使得攻击者即使获取了混淆后的图像,也难以通过反向传播或其他基于梯度的优化方法还原出有效的深层身份特征。该方法并非简单地在图像空间施加扰动,而是通过一种可学习的变换,使图像在视觉上仍保持自然的人脸外观,但在特征层面主动干扰攻击模型的梯度信息,从而阻止其学习到可迁移的身份表征。作者在多个公开人脸数据集上进行了实验评估,对比了不同黑盒和灰盒攻击场景下的防御效果,并验证了混淆图像对人脸验证系统(如商用 API)的可用性。实验结果表明,FaceObfuscator 在防御多种深度学习隐私攻击的同时,能维持较高的图像视觉质量和可用性,优于现有对抗扰动和隐私保护方法。该研究为解决人脸数据发布和共享中的隐私泄露问题提供了一种新的技术路径,特别适用于需要公开分享人脸数据但又要保护个体生物特征隐私的场景。本文适合从事隐私保护机器学习、对抗样本研究和人脸识别安全研究的研究人员阅读,也值得关注数据合规和隐私工程的开发者关注。
💡 推荐理由: 人脸图像在互联网上大量存在,基于深度学习的隐私攻击可从中窃取生物特征。FaceObfuscator 提供了一种兼顾可用性与隐私的防御思路,对数据发布、数据共享场景的隐私保护具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Simiao Xie, Chuancheng Shi, Shangze Li, Wenhua Wu, Fei Shen, Ying Zhou, Zhiyong Wang, Tat-Seng Chua
该论文针对开放权重大模型面临的白盒神经元级安全攻击问题,提出了一种分布式安全对齐(Distributed Safety Alignment, DSA)方法。研究背景是:随着开放权重模型快速发布,安全威胁已从黑盒越狱转向神经元级白盒攻击——攻击者可以直接定位并操纵与安全行为相关的神经元。现有对齐方法往往将安全行为集中在一小部分神经元上,形成脆弱的单点故障,缺乏冗余性。核心问题是如何在关键安全神经元被破坏时,仍能维持模型的整体安全基线。DSA 的核心思想是在多个计算神经元上冗余编码安全能力,避免依赖少数关键神经元。技术实现上,作者将干预定位在语言侧前馈网络的下投影层输入,将每个特征坐标视为单个神经元的激活。DSA 结合神经元激活与损失梯度,计算方向感知的一阶泰勒分数,用于全局识别对当前拒答行为贡献最大的神经元。随后,通过确定性掩码和随机丢弃(dropout)进行定向破坏,迫使模型放弃狭窄的安全神经元集合,并在多个补偿神经元上冗余编码安全行为。实验证明,DSA 能显著提升模型对白盒神经元级安全攻击的鲁棒性,同时保持模型在通用语言和多模态任务上的效用。该研究的主要贡献包括:提出分布式安全对齐范式、设计方向感知的神经元重要性评估方法、以及通过扰动训练实现安全能力的冗余分布。适合大模型安全研究人员、红队与蓝队安全工程师、以及模型对齐开发者阅读。
💡 推荐理由: 该研究直击开放权重模型中安全机制的单点故障问题,为抵御白盒神经元级攻击提供了新的对齐思路,对构建鲁棒的大模型防御体系具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jian Xiong, Wenbo Jiang, Zihan Wang, Rui Zhang, Wenshu Fan, Hongwei Li, Guowen Xu
本文提出了一种名为 InkShield 的主动式书写风格防御方法,旨在防止未经授权的手写体模仿攻击。近年来,手写文本生成器能够根据公开可获取的参考样本复制特定作者的书写风格,这可能导致文档伪造和身份盗用等风险。例如,攻击者可利用公开的手写笔记或签名样本,生成伪造的推荐信或授权表格,进而造成文件欺诈、身份滥用和误导性决策。已有的针对自然图像的编辑或合成防御手段难以直接迁移到手写风格模仿场景,因为这类方法通常针对具有复杂背景的自然图像优化扰动,且往往在全图像范围内添加扰动,而在稀疏的手写图像中,这种全局扰动会在空白背景区域显得十分突兀,严重损害视觉质量。为此,InkShield 在图像发布之前主动保护参考样本。其核心思路包括:首先选择一个诱饵书写者来定义风格位移方向;然后利用一个冻结的手写生成代理模型来优化扰动;最后将扰动限制在墨水笔画的边缘区域,以避免在空白背景上产生明显伪影。在 IAM 数据集上的实验表明,经过 InkShield 保护后,两个独立书写者评估器对生成样本检索为目标作者的平均 Top-1/Top-5 成功率分别从 11.94%/36.52% 降至 2.03%/8.79%。同时,保护后的参考图像与原始图像在感知上非常接近(LPIPS 0.0078),且生成的文本仍然可读。此外,InkShield 还表现出对其他手写生成器的可迁移性。总体而言,InkShield 为手写风格模仿提供了实用的防护手段。该研究面向计算机视觉、数字取证与隐私保护领域,尤其适合关注对抗性机器学习、生成模型安全以及文档真实性验证的研究人员和安全从业者阅读。由于仅基于论文摘要分析,具体技术细节和实验复现需查阅全文。
💡 推荐理由: 手写伪造攻击可直接用于生成虚假法律文件、推荐信或授权书,给个人和机构带来严重风险。InkShield 提供了一种轻量级、可迁移的主动防御思路,为文档安全与身份认证场景提供了实用工具。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Haoyu Zhang, Zhuoxi Wang, Shibo Zheng, Zijian Xiao, Xiangchen Guan, Mohammad Zandsalimy, Shanu Sushmita
该论文针对视觉语言模型(VLM)的安全防御问题,指出现有安全分类器(guard)作为主要黑盒防御手段,仅审查输入的表面形式而忽略其语义,导致恶意请求可以通过集合论、形式逻辑、罕见语言、代码或文本图像等编码方式绕过guard,形成“解码差距”。为了弥补这一缺口,作者提出了一个guard无关的“恢复-解码-重新守护”(Recover, Decode, Reguard)放大模块,在guard之前将图像内容转录并将编码文本还原为明文请求,使任何现成的分类器都能筛查真实意图。评估采用最严苛的攻击者假设:一个由十一种攻击组成的集合,只要任一攻击成功即判定为行为被击破(best-of-suite,遵循AutoAttack),这在越狱防御研究很少被报告。实验覆盖五个guard与两个目标VLM,结果显示:无防御时集合攻击可突破89-91%的行为;即使加上放大模块,最佳guard仍留下63-65%的失败率,且相对于单独使用guard,仅在十个guard-目标组合中有四个显著增益。进一步添加模块化的重新守护层可弥补大部分残余风险,但会使校准良好的guard对良性输入的过度拒绝率升至81-92%;而唯一保持可用性的宽松guard又无法达到部署级安全性(集合攻击成功率48%)。总之,在所研究的流水线以及针对表示转换攻击(即编码和跨模态渲染,留下可读载荷,而非像素或嵌入级攻击)下,没有任何配置能同时实现低攻击成功率和低过度拒绝。论文贡献包括:提出该放大模块、采用集合评估使安全-效用权衡可见,并绘制了基于恢复的VLM防御的有效区域与失效边界。
💡 推荐理由: 该研究揭示了当前VLM安全防御在编码攻击下的根本性缺陷,证明仅靠分类器表面检查无法保证安全,并给出可复现的集合评估方法,帮助蓝队理解安全与可用性的权衡。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Avinash Awasthi, Pritam Vediya, Hemant Miranka, Ramesh Babu Battula, Manoj Singh Gaur
物联网设备的快速普及带来了资源受限和安全漏洞增多的挑战,传统基于静态签名或规则匹配的入侵检测系统已难以应对现代、自动化且新颖的零日攻击。现有的机器学习IDS模型在面对概念漂移和未知威胁时泛化能力不足。针对上述问题,本文提出PANDORA(Probabilistic Adversarial Network Defense Over Resource-constrained Architectures),一个面向边缘设备检测零日攻击的端到端框架。PANDORA的核心贡献有三:1)通过学习不确定性感知的概率嵌入,生成网络流量的鲁棒表示;2)提出新的概率流形结构距离(PMSD)损失函数,实现有效的零样本泛化;3)采用高效的Mamba-MoE(Mixture of Experts)架构,便于设备端部署。为验证方法,作者还构建了TTDFIoTIDS2025数据集,包含复杂、程序生成的攻击。实验结果表明,PANDORA在CICIDS2017上仅需10样本微调即可达到0.971的F1分数;在域迁移下的零样本检测准确率高达99%;在树莓派上部署时内存占用仅24MB,吞吐量达4.26 flows/s,证明了其实时边缘安全防护的实用性。
💡 推荐理由: 该工作针对边缘IoT设备资源受限的特点,提出轻量级零日攻击检测方案,解决了传统IDS泛化性差和概念漂移问题,对提升网络边缘安全防御能力具有实际意义。
🎯 建议动作: 研究跟进,评估方法在自有边缘设备或网络中的适用性
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohammed Aldeen, Muhammad Sami Irfan, Sagar Dasgupta, Long Cheng, Mizanur Rahman, Mashrur Chowdhury
该论文针对自动驾驶汽车(AV)依赖全球导航卫星系统(GNSS)进行定位和导航,易受欺骗攻击(如轨迹重定向、急停等)的问题,提出了首个基于视觉-语言模型(VLM)的GNSS欺骗检测框架。方法创新地融合了前置摄像头视觉数据与车载传感器读数(速度、加速度、偏航率),并与GNSS导出的机动行为进行对比。作者设计了三阶段微调流程:首先对齐视觉线索,然后在共享语义空间中校准传感器数据,以检测在三种攻击场景下预测机动与GNSS导出机动之间的差异。为验证模型跨区域泛化能力,团队在阿拉巴马州塔斯卡卢萨县公共道路上采集了实车数据集(含时间同步的GNSS、IMU和相机日志),并生成了智能欺骗攻击样本,包括带道路网络匹配的轨迹镜像(错误转弯攻击)、位置冻结(过冲攻击)和漂移生成(停车攻击)。实验表明:零样本VLM基线F1分数仅为23%-32%,而微调后的模型F1分数达到94%-95%;错误转弯和停车攻击分类准确率100%,过冲攻击准确率88%-93%。此外,引入自适应推理策略将VLM调用次数降至14%(计算量减少约86%),每4秒窗口处理时间为65-73毫秒,证明了该方法作为实际道路上补充信号级完整性检查的防御层的可行性。
💡 推荐理由: 首次将VLM应用于自动驾驶GNSS欺骗检测,通过多模态融合实现高精度(>94% F1)且低计算开销(86%推理减少),为自动驾驶安全提供了新颖的感知级防御思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Ji He, Ying Wang, Lijie Zheng, Xinghui Zhu, Yulong Shen, Xiaohong Jiang
本文研究了车联网(V2X)协同感知中的安全漏洞。协同感知通过连接车辆交换中间特征来提高自动驾驶感知能力,其中置信度驱动的稀疏通信仅传输感知关键的空间区域以降低带宽。然而,一旦协作方被攻陷,攻击者可以在高置信度或自车不确定区域注入恶意特征,这些特征在融合过程中会被优先选中并放大。以Where2comm框架为例,作者提出了一种伪善良(Pretend Benign)攻击,利用其空间置信度机制,在不确定但感知关键的区域注入隐蔽扰动,严重降低3D目标检测性能,同时保持类似良性特征。此外,作者指出现有信任防御的弱点:它们主要依赖单一一致性信号,当多个攻击者形成伪共识以偏置信任估计时,容易受到攻击。为此,本文提出了一种轻量级防御——全局-局部结构信任(GLST),通过三种互补视角评估协作方可靠性:全局特征一致性、多尺度局部残差一致性和与自车语义拓扑的结构一致性。由此产生的信任分数指导特征融合,抑制不可靠的协作方。在OPV2V数据集上的实验表明,GLST在面对单攻击者伪善良攻击时具有竞争力的性能,在多攻击者场景下鲁棒性显著增强。在四攻击者伪善良攻击下,GLST保持了0.69 AP@0.3,而现有单信号防御严重退化。GLST对基于梯度的攻击(如PGD)也有效,表明多级信任建模对于保护置信度驱动的协同感知至关重要。本文适合对自动驾驶安全性、V2X通信和对抗性防御感兴趣的研究人员阅读。
💡 推荐理由: 揭示了V2X协同感知中置信度驱动机制的固有安全风险,提出了一种有效的多维度信任防御方法,对保障自动驾驶系统安全具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohamed Amine Merzouk, Nolan Smyth, Damiano Fornasiere, Linh Le, David Williams-King, Adam Oberman
大语言模型(LLM)的安全对齐方法容易受到对抗性攻击的威胁,现有的防御手段如隐对抗训练(LAT)虽然有效,但需要大量有害提示数据,且可能损害模型效用。本研究提出了一种名为隐人格对齐(Latent Personality Alignment, LPA)的新方法,旨在高效且鲁棒地实现安全对齐。LPA的核心思想是:人格锚定表示与有害回避之间存在共享的隐空间结构,因此通过对少量(仅66条)无害的心理学人格陈述进行对抗性稳定,可以隐式约束被越狱攻击利用的子空间,从而避免显式拒绝有害内容所需的昂贵训练。实验表明,LPA在HarmBench基准上,针对直接请求和五种越狱方法均实现了接近零的攻击成功率,且模型在标准基准测试中性能无损失。此外,LPA的训练非常轻量:整个过程可在单块GPU上几分钟内完成,使用的示例数量比标准LAT少75倍。广泛的消融实验验证了该方法的鲁棒性、效率和泛化能力。
💡 推荐理由: 提出了一种无需接触有害样本就能实现高鲁棒安全对齐的轻量方法,大幅降低训练成本,同时保持模型效用,为LLM安全部署提供了实用的新思路。
🎯 建议动作: 研究跟进 |
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Andrew C. Cullen, Neil Marchant, Jiani Xie, Paul Montague, Benjamin I. P. Rubinstein
自动语音识别(ASR)系统对对抗性和良性扰动高度敏感,但现有检测方法因缺乏真实转录的先验知识而难以在部署系统中实施。本文提出一种基于认证思想的鲁棒性增强方法,通过双门控诊断管道提升系统可靠性。该管道包含两个核心模块:一是“两侧原子审计”,通过累积统计证据来认证令牌的存在和对抗性排除;二是“基于排名的竞赛”,从候选序列中选择获胜转录。在四种不同架构(如DeepSpeech、QuartzNet等)上的实验表明,该方法能使词错误率相对降低高达55%,同时提供细粒度的单词级和句子级鲁棒性认证。该工作为ASR系统的声学安全性提供了一种可证明的保障机制,有助于在真实场景中抵御扰动。
💡 推荐理由: 该研究为ASR系统提供了一种可认证的鲁棒性增强方法,显著降低词错误率,解决了部署环境中无法获得真实转录的检测难题,对提升语音交互系统的安全性具有重要意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lena Libon, Pura Peetathawatchai, Michael Aerni, Daniel Paleka, Florian Tramèr
本文针对黑盒大语言模型(LLM)的蒸馏攻击防御问题展开研究。蒸馏攻击指攻击者通过查询API接口获取教师模型输出,并训练学生模型来复制其能力。近期研究提出输出扰动防御方法,通过修改教师模型输出降低学生模型性能,同时保持对合法用户的可用性。然而,作为较新的防御家族,输出扰动防御缺乏统一的威胁模型,导致难以比较不同方法、评估其与其他攻击的组合效果,或验证其对真实世界攻击者的鲁棒性。这种威胁模型不完备会带来安全隐患:当防御被用于保护知识产权或满足监管合规要求时,模糊的威胁模型可能造成虚假的安全感。作者提出一个三维威胁模型框架,将攻击者能力描述为:查询预算(API调用次数)、数据预算(训练学生模型的数据量)以及接口配置文件(攻击者与API的交互方式)。以anti-distillation采样为案例,作者展示防御是否有效取决于假定的威胁模型。论文主张,未来的蒸馏防御研究以及基于其构建的治理或政策框架,应明确指定并压力测试攻击者在三个维度上的能力。
💡 推荐理由: 该研究揭示了当前蒸馏防御评估中威胁模型不统一的关键问题,为安全从业者提供了评估防御有效性的系统框架,避免因模糊假设导致虚假安全感。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shuhao Chen, Weisen Jiang, Yeqi Gong, Shengda Luo, Chengxiang Zhuo, Zang Li, James T. Kwok, Yu Zhang
论文 SPARD 针对大型语言模型在微调过程中安全对齐被破坏的问题,尤其是有害微调攻击(通过对抗性数据移除安全防护并引发不安全行为),提出了一种防御框架。该框架包含两个核心组件:1)安全投影交替优化(SPAG),在效用更新与显式安全投影之间交替优化,利用一组安全数据强制实施安全约束;2)相关性-多样性感知数据选择(Relevance-Diversity Determinantal Point Process),从原始数据中挑选紧凑的安全数据子集,平衡任务相关性与安全覆盖度。在 GSM8K 和 OpenBookQA 数据集上,针对四种有害微调攻击的实验表明,SPARD 在平均攻击成功率上显著低于现有最先进防御方法,同时保持较高的任务准确率。论文代码已开源。该工作适合关注 LLM 安全微调、对抗防御的研究者阅读。
💡 推荐理由: LLM 微调安全对齐是实际部署中的关键问题,SPARD 提供了一种可落地的防御框架,在不显著牺牲任务性能的前提下有效抵御有害微调攻击。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Aditya Sridhar
概念瓶颈模型(CBM)是可解释机器学习的重要方法,通过显式的概念激活提供人类可理解的中间表示。然而,这种可解释性引入了一个此前未被探索的攻击面:概念瓶颈层本身。本文首次系统性地研究了CBM在概念层面的对抗性脆弱性,发现针对输入像素的微小、定向扰动可通过操纵语义表示导致灾难性的分类错误。作者建立了一个严格的理论框架来量化概念空间的鲁棒性,提出了新的度量标准,揭示了这些架构的脆弱性景观。在CUB-200-2011数据集上的广泛分析表明,标准CBM对概念级操纵表现出严重的脆弱性。为应对这一关键弱点,作者引入了SPECTRA(基于语义扰动的概念训练以增强鲁棒性),这是一种原则性的稳定性正则化防御。SPECTRA有效地强化了语义表示空间,将成功攻击所需的最小扰动范数从0.46提高到超过4200,使得定向概念操纵在计算上不可行。此外,SPECTRA将基线分类准确率保持在2.2%以内。通过将概念级攻击确立为一个根本不同的威胁模型,这项工作在可解释机器学习与对抗鲁棒性的交叉领域开辟了一个新的研究前沿。
💡 推荐理由: 首次揭示可解释CBM自身的高危攻击面:通过微小像素扰动操纵中间概念层即可导致分类失效,威胁依赖CBM的安全关键应用(如医疗影像、自动驾驶)。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ziyuan Chen, Yueming Lyu, Yi Liu, Weixiang Han, Jing Dong, Caifeng Shan, Tieniu Tan
该论文针对检索增强生成(RAG)系统在动态网络搜索场景中易受对抗性攻击的问题,提出了一种名为RADAR的动态防御框架。现有静态防御方法难以应对不断演变的攻击模式,且在动态环境中存储成本过高。RADAR将可靠的上下文选择建模为基于图的能量最小化问题,并通过最大流最小割定理精确求解。框架引入贝叶斯记忆节点,递归更新信念状态而非存储原始历史文档,从而在抵御攻击的稳定性与适应真实知识变化之间取得平衡。实验在作者构建的动态数据集上进行,结果表明,与基线方法相比,RADAR在鲁棒性和响应质量上均表现更优,且存储开销极小。该工作主要贡献在于:1)首次将RAG的上下文选择形式化为能量最小化问题;2)提出动态信念更新机制,避免历史文档的冗余存储;3)设计动态评估数据集,更贴近实际应用场景。适合从事LLM安全、对抗性机器学习的从业者阅读。
💡 推荐理由: RAG系统已广泛应用于问答、搜索等场景,但其对检索内容的依赖使其易受检索投毒攻击。RADAR提供了一种低开销的动态防御方案,有助于提升RAG在实际部署中的安全性。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chengcai Gao, Zhihong Sun, Xiaochuan Shi, Qiufeng Wang, Chao Liang
本文针对检索增强生成(RAG)系统面临的安全威胁,提出了一种名为BiRD(双向排序防御机制)的新型防御方法。研究首先识别了现有防御手段(如基于语义分析或投票机制)的核心局限性:它们仅关注语义内容相关性,而忽略了由排序结构定义的检索上下文。通过对被毒化文档与良性文档的双向排序行为分析,作者发现了一个关键区分模式:被毒化文档的反向排序与查询的正向排序之间表现出显著更强的对齐性。利用这一发现,BiRD构建了一个双信号框架,其中正向排序用于评估语义内容相关性,反向排序用于量化排序上下文的一致性,从而同时实现了高效性和鲁棒性。在3个数据集、3种检索器和3种大语言模型上,针对2种攻击场景的广泛评估验证了BiRD的有效性。特别地,BiRD将PoisonedRAG攻击的成功率降低高达54%,同时将任务准确率提升高达56%,且平均额外延迟低于1秒。该工作为RAG系统的对抗性防御提供了新思路,适合研究对抗机器学习、RAG安全以及信息检索的学者和工程师阅读。
💡 推荐理由: RAG系统正面临日益严重的对抗性攻击,现有防御存在计算成本高或鲁棒性不足的问题。BiRD利用双向排序模式差异,以低延迟实现高防御效果,为实际部署提供了可行方案。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tri Cao, Yulin Chen, Hieu Cao, Yibo Li, Khoi Le, Thong Nguyen, Yuexin Li, Yufei He, Yue Liu, Shuicheng Yan, Bryan Hooi
本文针对 Web Agent 在开放网络环境中面临的提示注入攻击风险,提出了一种鲁棒防御模型 WARD。Web Agent 可通过与网站交互自动完成在线任务,但其依赖的 HTML 内容或视觉界面易被嵌入恶意指令,导致提示注入攻击。现有防护模型存在泛化能力差(对未见领域及攻击模式识别率低)、对良性内容误报率高、引入额外延迟影响部署效率、且难以应对随时间演化的对抗攻击等问题。为解决这些局限,作者构建了 WARD-Base 大规模数据集(包含来自 719 个高流量 URL 和平台的约 17.7 万样本),以及专门针对防护模型本身的提示注入攻击数据集 WARD-PIG。在此基础上,提出 A3T(自适应对抗攻击训练框架),通过基于记忆的攻击者与防护者协同进化过程迭代增强 WARD 的鲁棒性。大量实验表明,WARD 在分布外基准上实现了近乎完美的召回率,同时保持低误报率以保障 Agent 可用性;在遭遇针对防护模型的攻击和自适应攻击时,仍能在显著分布偏移下保持鲁棒;并且可与 Agent 并行运行,不引入额外延迟。该研究为 Web Agent 的安全部署提供了实用且高效的防护方案。
💡 推荐理由: 随着 Web Agent 在自动化任务中广泛应用,提示注入攻击成为严峻威胁。WARD 提出了首个兼顾高检测率、低误报、高效率和抗对抗攻击的防护模型,对保障 LLM 驱动的 Agent 安全至关重要。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu
该论文针对大视觉语言模型(LVLM)在多模态网页数据上遭受的未授权爬取和训练问题,提出了一种名为MMGuard的主动防御方法。现有对策如机器遗忘和水印均属于事后处理,无法在知识产权侵犯发生前进行保护。MMGuard通过生成难以学习的样本(unlearnable examples),向多模态数据注入人眼不可察觉的扰动。该扰动利用LVLM的学习动态,最小化训练损失,从而创建优化捷径,使模型在训练时过度拟合噪声,而在推理时因扰动消失导致下游任务性能严重下降。为加强防御,MMGuard进一步引入跨模态绑定破坏机制,策略性地转移LVLM的注意力,强制噪声与训练目标之间产生虚假相关性,并从理论上证明了其有效性。此外,采用集成学习策略增强跨模型迁移能力,使扰动在不同LVLM架构间具有通用性。在9个开源LVLM和6个数据集上的实验表明,MMGuard在白盒、灰盒和黑盒威胁模型下均能提供有效、隐蔽且鲁棒的防护,证明其在主动防御未授权微调方面具有机制性优势。该研究适合关注数据版权保护、对抗性机器学习和多模态模型安全的研究人员与从业者阅读。
💡 推荐理由: 数据所有者面临多模态数据被未授权微调的严重风险,MMGuard提供了首个主动防御方案,可在侵权发生前阻止模型从数据中学习,对版权保护和隐私维护具有重要价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Zheng Lin, Zhenxing Niu, Haoxuan Ji, Haichang Gao
本文提出了一种针对大型语言模型 (LLM) 的保证性越狱防御方法——Disrupt-and-Rectify Smoothing (DR-Smoothing)。该方法受对抗防御领域中去噪平滑技术的启发,将两阶段提示处理方案(先干扰输入提示,再修正)集成到传统平滑防御框架中。与先前仅干扰的方法相比,本方法通过将分布外(out-of-distribution)的干扰提示恢复为分布内形式,降低了LLM行为不可预测的风险。此外,这种两阶段方案在越狱防御中实现了无害性与有用性之间的有效平衡。作者给出了通用平滑框架的理论分析,提供了防御成功概率的紧界以及对干扰强度的要求。DR-Smoothing能够防御令牌级和提示级的越狱攻击,包括在已建立和自适应攻击场景下。大量实验表明,该方法在无害性和有用性两方面均超越了当前最先进的防御方法。本文适合LLM安全研究人员、AI防御系统开发者以及关注生成模型鲁棒性的从业者阅读。
💡 推荐理由: 该工作为LLM越狱防御提供了理论保证和实用方法,平衡了安全性与可用性,对提升生成式AI系统的可信赖性有重要意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Wei Zhao, Zhe Li, Yige Li, Jun Sun 0001
多模态大语言模型(MLLMs)在跨模态理解方面表现出色,但其视觉输入模块容易受到对抗攻击,即使文本安全机制完善。这些漏洞源于两个核心弱点:视觉表征的连续性允许基于梯度的攻击,以及文本安全机制无法充分迁移到视觉内容。本文提出 Q-MLLM,一种集成两级向量量化的新颖架构,通过创建离散瓶颈来抵御对抗攻击,同时保持多模态推理能力。该方法在像素块级和语义级对视觉表征进行离散化,阻断攻击路径并弥合跨模态安全对齐鸿沟。两阶段训练策略确保了鲁棒学习并维持模型效用。实验表明,Q-MLLM 在防御越狱攻击和有毒图像攻击方面显著优于现有方法,对越狱攻击实现了 100% 的防御成功率(仅有一个可争议案例除外),同时在多个效用基准上保持竞争性能,且推理开销极低。这项工作将向量量化确立了一种有效的防御机制,无需昂贵的专门安全微调或检测开销。
💡 推荐理由: 为多模态大模型提供了一种轻量、高效的对抗防御方案,无需额外安全微调即可实现近乎完美的越狱攻击防御,对提升 AI 系统安全性具有直接实用价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)