👥 作者: Sujin Chen, Lijun Li, Tianyi Du, Jing Shao
本文提出 MobileWorldSafety,一个针对真实 Android 应用上 GUI 智能体安全性的基准测试,聚焦环境注入攻击(包括间接提示注入和对抗性指令)。随着 LLM 驱动的 GUI 智能体从研究原型走向早期真实部署,它们经常处理不可信的环境内容,因此极易受到此类攻击。现有基准往往未能覆盖日常移动使用场景,缺乏对移动设备上 GUI 智能体在环境注入攻击下的系统评估。MobileWorldSafety 包含 142 个风险任务,构建于真实 Android 应用之上。每个任务都定义了基于最终系统状态的可编程验证风险指标,并采用两阶段评估流水线:规则验证处理明确情况,LLM 法官裁决模糊情况,从而区分安全性失败与能力失败,确保评估客观可复现。作者评估了六个智能体,包括通用智能体和专用 GUI 智能体,结果显示所有智能体均高度脆弱,攻击成功率从 40.4% 到 66.9% 不等。这表明当对抗性内容以普通移动上下文呈现时,当前智能体往往无法维持安全对齐。该工作为量化这类漏洞和推动鲁棒移动 GUI 智能体研究奠定了基础。适合关注 LLM 智能体安全、移动端 AI 安全以及对抗性机器学习的研究人员和工程师阅读。
💡 推荐理由: 首次系统评估真实 Android 应用上 GUI 智能体对环境注入攻击的脆弱性,揭示普遍高风险,为蓝队和移动安全工程师提供量化基线。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sri Hrushikesh Varma Bhupathiraju, Shaoyuan Xie, Michael Clifford, Qi Alfred Chen, Takeshi Sugawara 0001, Sara Rampazzi
本文研究自动驾驶系统中热成像感知模块的安全性,重点关注热成像摄像头在物理世界攻击下的脆弱性。作者首先系统性地分析了热成像感知在自动驾驶中的应用场景,包括行人检测、车辆检测和障碍物识别等,并指出热成像传感器虽在低光照条件下具有优势,但其物理特性可能被恶意利用。研究提出了一种针对热成像感知的攻击方法,通过操纵环境温度或使用特定热源产生对抗性热模式,使热成像模型产生误判,如将行人识别为背景或车辆。文章进一步通过实验验证了攻击的有效性,在真实场景和仿真环境中展示了攻击对主流热成像目标检测算法的影响。为缓解此类风险,作者提出了包括对抗训练、输入验证和传感器融合在内的防御策略,并讨论了其有效性。该研究揭示了热成像感知在自动驾驶中的安全盲区,为设计鲁棒的多模态感知系统提供了重要参考。
💡 推荐理由: 热成像感知是自动驾驶安全的关键组成部分,本文揭示其可被物理攻击干扰,对车辆安全决策构成直接威胁。蓝队需关注此类传感器攻击对AI系统可靠性的影响。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alireza Bahramali, Milad Nasr, Amir Houmansadr, Dennis Goeckel, Don Towsley
该论文针对基于深度神经网络(DNN)的无线通信系统面临的安全威胁展开系统性研究。近年来,DNN被广泛应用于无线通信的关键环节,如OFDM系统的信道估计与解码、端到端自编码器系统设计、无线电信号分类以及信号认证等任务。然而,DNN本身存在对抗样本脆弱性,这可能使无线系统受到攻击并导致功能失效。作者提出一种生成鲁棒对抗样本的方法,以满足无线场景中的特殊约束。具体而言,该方法将对抗扰动生成建模为一个优化问题,该优化问题融入了不同无线系统特有的领域约束(如功率限制、频谱掩蔽、误码率影响等),从而能够生成满足以下关键特性的无线对抗扰动:一是可在线实时应用,无需预先知道目标信号;二是与自然无线噪声不可区分,具有隐蔽性;三是对抗去除机制具有鲁棒性,即使通信双方部署了防御措施,扰动依然有效。作者通过大量实验验证了攻击性能,并与现有针对DNN无线系统的攻击方法进行了对比。结果表明,在通信双方采用合理防御机制的情况下,所提出的攻击方法仍显著优于现有攻击,这揭示了基于DNN的无线通信系统在面对对抗攻击时的脆弱性。该研究对在鲁棒无线通信中采用DNN的可行性提出了质疑,并为无线AI安全领域提供了重要的警示。适合无线通信安全研究人员、DNN鲁棒性研究者以及关注物理层安全的工程师阅读。
💡 推荐理由: 该研究首次系统性地展示了针对无线DNN系统的鲁棒对抗攻击,即使存在防御措施仍能成功,为无线AI安全敲响警钟,帮助蓝队理解物理层攻击面。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Wenbo Sun, Hongzong LI, Yanyun Wang, Jiahao MA, Shuxin Zhuang, Rong Feng, Shiqin Tang, Zi Liang
本文针对深度OCR系统(具体为DeepSeek-OCR)提出了首个纯黑盒对抗攻击方法。Deep-OCR将视觉模态视为光学压缩介质,以低token成本实现长上下文OCR,但其复杂性也引入了新的安全风险。作者将攻击问题重构为一个零阶优化问题:仅能查询解码后的字符串输出,无法获取梯度、logits或模型内部信息。他们直接在字符串输出上定义了基于序列相似性的有界标量损失函数,并采用随机方向有限差分方案估计梯度,该方案的查询成本与图像维度无关。通过带ell_infinity投影的Adam更新,实现对无目标和有目标对抗扰动的生成,且扰动具有不可感知性。初步实验在Deep-OCR上验证了仅字符串攻击和评估流程的有效性,同时暴露了严重的解码器故障,包括重复、截断和提示泄露。实验还表明,受控的目标重写比无目标退化困难得多;在预注册评估完成前,作者未声称目标攻击成功。
💡 推荐理由: 首次对生成式OCR视觉语言模型进行纯黑盒对抗攻击,揭示了文档识别系统在仅有字符串输出时仍可被攻击,对依赖OCR的自动化流程构成威胁。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Guangke Chen, Sen Chen 0001, Lingling Fan 0003, Xiaoning Du 0001, Zhe Zhao 0007, Fu Song, Yang Liu 0003
该论文针对语音说话人识别系统(SRS)在真实黑盒场景下的安全性进行了首次系统性研究。说话人识别作为生物特征认证和身份识别机制已被广泛使用,但现有对抗攻击研究大多局限于白盒设置,即攻击者对模型结构和参数有完全知识;而在实际应用中,攻击者通常只能通过查询接口获取有限的输出信息,因此黑盒攻击的可行性仍属开放问题。为此,作者提出了一种名为 FAKEBOB 的黑盒对抗攻击方法。其核心思路是将对抗样本生成建模为一个优化问题,在考虑对抗样本置信度和最大扰动之间平衡的同时,实现攻击强度与不可感知性的兼顾。关键创新在于提出了一种估计算法,用于估算说话人识别系统中使用的分数阈值(score threshold),并将该阈值引入优化目标,从而有效求解优化问题。实验表明,FAKEBOB 在开源系统和商业系统上均能达到 99% 的定向攻击成功率;在物理世界通过空中播放时同样有效。此外,作者进行的人工测试显示,人类很难区分原始语音和对抗语音的说话人。最后,论文将语音识别领域常用的四种对抗防御方法迁移到说话人识别场景,发现这些方法对 FAKEBOB 均无效,说明需要针对 SRS 设计更有效的防御手段。该研究揭示了说话人识别系统在黑盒条件下的安全脆弱性,并推动了其安全鲁棒性改进。注意:本摘要仅基于论文摘要,未涉及具体攻击实现细节。
💡 推荐理由: 该研究首次证明黑盒场景下说话人识别系统可被高成功率定向欺骗,且人类无法察觉;还暴露了现有语音防御方法在 SRS 上的失效,对生物识别安全构成现实威胁。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Reza Khanmohammadi, Ivan Brugere, Simerjot Kaur, Charese H. Smiley, Kundan Thind, Mohammad M. Ghassemi
该论文研究视觉语言系统(VLM)在基于答案保留的攻击下置信度读数的鲁棒性。作者提出一个信息性-可操作性边界(informativeness-manipulability frontier),用于刻画攻击者在保持生成答案逐字节不变的前提下,能够操纵模型置信度输出的程度。在可到达性假设下,不可移动的置信度读数无法胜过答案字符串准确率先验(合并值为0.617)。独立于该假设,低于可测阈值的均匀幅值证书可保证对抗性判别高于同一底线。作者在四个视觉语言模型、三个视觉问答基准、五个部署置信度通道和两个防御估计器上进行了实验,发现直接或代理攻击能产生逐项可行的扰动,并在所有84个估计器-单元组合中反驳该统一证书。进一步,协调的正确性标签感知攻击将对抗性判别降至或低于答案字符串底线,在所有60个部署通道单元中均如此,包括59个初始高于该底线的单元。隐藏状态干预和开放文本模型激活空间复制表明,类似的置信度移动可在表示层面诱导,而不仅依赖对抗图像。测试的四个防御家族在各自评估下均未建立稳健替代方案。在置信度门控模拟中,协调的token概率攻击转移到隐藏状态门控后,高达84.8%的先前被拒绝的错误答案被接受;按基准自然正确率重新加权后,转移场景下12个单元中有8个、直接门控攻击下所有12个单元的接受准确率均低于无门控基线。结论是:在所研究的威胁模型和预算下,置信度是完整性敏感的监督信号,而非内在稳健的信号。该工作适合研究对抗鲁棒性、VLM安全、以及依赖置信度过滤的部署者阅读。
💡 推荐理由: 许多实际系统将置信度作为拒绝低质量答案的门控信号,该研究揭示攻击者可在不改变答案的情况下操纵置信度,导致门控失效。对依赖VLM安全过滤的蓝队而言,这意味着置信度本身不可作为可靠防线,需引入额外校验机制。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohammad Imtiaz Hasan, M Sabbir Salek, Nathan Jones, Mashrur Chowdhury, Rong Ge
本文研究攻击者如何通过操纵视频帧来破坏基于视频感知系统的安全性。这类系统广泛应用于智能交通,支撑着交通信号优化、行人检测等安全关键功能。作者提出了一种端到端的快速目标移除攻击框架,可在视频帧中删除特定目标(如车辆、行人),同时保持视觉连贯性。框架分为四步:首先在每一帧中定位目标,然后从先前帧中检索与该目标所在区域最相似的背景补丁,接着利用上下文敏感的alpha混合将补丁无缝融入,最后重建整个攻击帧。该方法不依赖对抗噪声,而是利用视频时间一致性生成自然的内容。实验在南卡罗来纳州互联车辆测试平台的交叉口场景中进行,结果显示重建帧与真实帧的PSNR超过40dB、SSIM超过0.996,在感知上几乎不可察觉。面对基于YOLO的检测器,目标检测数量最多减少97.59%,单帧攻击成功率达到94.48%。在GPU环境下,每帧处理时间为0.074至0.172秒,接近实时要求。取证方面,多个预训练的篡改检测模型无法可靠区分重建帧与真帧,说明攻击具有高度隐蔽性。该研究首次系统性地评估了视频感知系统中目标移除攻击的可行性,揭示了此类安全关键系统在对抗环境下的脆弱性,并为后续防御研究(如视频内容认证、异常检测)提供了理论依据和实验基础。对于从事自动驾驶、智慧交通安全的工程师和研究者,本文具有重要参考价值。
💡 推荐理由: 视频感知系统支撑安全关键应用,目标移除攻击可导致行人或车辆漏检,引发交通事故。安全从业者需了解此类攻击方法以设计有效的防御与检测策略。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhuohang Li, Cong Shi 0004, Tianfang Zhang, Yi Xie 0001, Jian Liu 0001, Bo Yuan 0001, Yingying Chen 0001
本文针对智能音频系统面临的各种机器诱导音频攻击(包括重放攻击、合成攻击、隐藏语音命令、不可听攻击和音频对抗样本)提出了一种统一的检测方案。现有防御通常针对单一攻击类型,难以整合成通用方案。智能设备(如Amazon Echo、Apple HomePod)普遍配备麦克风阵列,但少有研究利用多声道音频进行通用防御。作者利用多声道音频的幅度和相位谱提取空间信息,通过深度学习模型捕捉人声与机器播放音频之间的根本差异。为提高在新声学环境下的泛化能力,采用了无监督域自适应训练框架。在公开的多声道重放攻击数据集和自收集的包含5种高级攻击的多声道音频数据集上进行了评估,结果显示该方法在检测各类机器诱导攻击时等错误率(EER)低至6.6%,即使在新环境中EER也仅为8.8%。该研究为智能音频系统提供了一种实用、可部署的统合防御框架。
💡 推荐理由: 为智能音频设备(如智能音箱、语音助手)提供了一种统一、高效的多声道防御方案,填补了现有防御针对单个攻击类型、实用性差的空白。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Li Zeng, Zeyu Ye, Meng Xie, Hangtao Zhang, Xianlong Wang, Yanchun Li, Zhetao Li
本文针对视觉语言模型(VLM)在对抗性攻击下的脆弱性展开研究。现有基于文本的对抗攻击方法大多从纯语言模型迁移而来,其提示优化过程中固定视觉输入,导致生成的对抗提示与特定图像绑定,跨图像迁移性差。为突破这一局限,作者首次提出“对抗提示的跨图像迁移性”这一新视角,并设计了一种名为 GhostPrompt 的对抗提示生成方法。GhostPrompt 通过联合优化方式,将图像不变的对抗特征蒸馏到文本提示中:算法交替进行“最坏情况”生成,即先为当前提示构造最难的视觉条件(如添加扰动或选择特定图像),然后更新提示使其在这些条件下依然有效。这样优化得到的对抗提示可被复用,在多种不同图像上诱导 VLM 输出攻击者指定的错误响应。在多个主流 VLM 上的实验表明,与最先进基线相比,GhostPrompt 的攻击成功率提升超过 30%,同时计算时间减少约 70%。该研究揭示了 VLM 在多模态场景下面临的新型威胁,对模型鲁棒性评估和防御策略设计具有重要参考价值。代码已开源。
💡 推荐理由: 首次提出对抗提示的跨图像迁移概念,显著降低攻击计算开销,威胁面从单图像扩展到多图像,对 VLM 部署安全构成新挑战。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shenchen Zhu, Yue Zhao 0018, Kai Chen 0012, Bo Wang, Hualong Ma, Cheng'an Wei
该论文提出一种名为AE-Morpher的方法,旨在提高对抗性物体对基于LiDAR的检测器的物理鲁棒性。在自动驾驶等安全关键应用中,LiDAR传感器常被用于环境感知,而对抗性攻击(如通过修改物体外观欺骗检测器)在数字域已被广泛研究,但在物理域中,由于视角、光照、遮挡等环境因素,对抗性攻击的有效性往往下降。AE-Morpher通过物体重建技术,将对抗性扰动融入物体的几何形状或材料属性中,使得对抗性物体在物理世界中具有更强的稳定性和可迁移性。具体来说,该方法利用可微渲染和3D重建技术,优化物体的表面纹理或形状,使其在不同视角和距离下均能有效欺骗LiDAR点云检测器。实验在多种LiDAR检测模型(如PointPillars、VoxelNet)和数据集上进行,结果表明,与现有物理对抗攻击方法相比,AE-Morpher生成的对抗性物体在物理模拟和真实世界中均表现出更高的攻击成功率和鲁棒性。该研究揭示了LiDAR检测器在物理世界中的潜在脆弱性,为设计更安全的自动驾驶系统提供了重要参考。
💡 推荐理由: LiDAR是自动驾驶的核心传感器,其安全性直接影响行车安全。该研究展示了一种可实际部署的物理对抗攻击方法,帮助安全社区理解LiDAR检测器的物理局限性,从而推动更鲁棒的防御策略。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Khushnaseeb Roshan
该论文针对网络入侵检测系统(NIDS)面临的对抗性攻击威胁,提出了一种混合防御方法。NIDS是保护网络免受未知网络威胁的关键工具,但它容易受到对抗性攻击,攻击者通过构造对抗样本欺骗NIDS,将恶意流量误分类为良性。研究聚焦于两种强大的白盒对抗攻击:快速梯度符号法(FGSM)和Carlini & Wagner(C&W)攻击。作者开发了一种鲁棒的混合防御机制,结合了两种启发式防御方法:对抗训练(AT)和高斯数据增强(GDA)。GDA提供多方向防御,而AT增强NIDS对特定对抗向量的鲁棒性。在预攻击场景下,NIDS表现出良好的准确率和F1分数。但在攻击后,NIDS在FGSM和C&W攻击下的准确率分别显著下降至0.2649和0.4961。所提出的混合防御方法有效缓解了这些对抗威胁,对于FGSM和C&W攻击,防御后准确率分别达到96.57%和89.20%。研究在ε和置信噪声因子值范围(0.0001至0.0009)内评估了防御策略。该研究为安全视角下对抗机器学习这一新兴领域的研究人员提供了方向。适合NIDS安全、对抗机器学习研究人员阅读。
💡 推荐理由: 为NIDS抵御白盒对抗攻击提供了实用的混合防御方案,实验验证了高防御性能,对提升实际网络环境下的入侵检测系统安全性有参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuchen Ren, Zhengyu Zhao, Chenhao Lin, Bo Yang, Chao Shen
视觉-语言预训练模型(VLPMs)已被证实容易受到对抗性攻击。现有的可迁移攻击通常采用复杂的损失函数或多阶段文本/图像攻击流程,但本文发现这些复杂设计反而存在三个先前被忽视的问题:不恰当的跨模态交互和冗余操作导致攻击效果受限。为解决这些问题,作者提出简单视觉-语言攻击(SimVLA)流程,通过简化跨模态交互(如跨模态单词识别)并去除不必要的复杂损失函数和多阶段设计,显著提升了攻击的可迁移性和效率。在四个数据集和三个下游任务(如图像-文本检索)上的实验表明,SimVLA在Flickr30k数据集上的R@1可迁移性超越当前最优基线8.01%-14.71%,同时仅消耗约35.73%的时间和46.26%的最大显存。该工作强调领域知识(如跨模态单词识别)的重要性,而盲目追求复杂操作反而有害。代码已开源。本研究面向视觉-语言安全领域的研究人员和防御者,揭示了当前攻击流程中过度复杂化的弊端,并提供了一个简单且高效的攻击基线。
💡 推荐理由: 该研究揭示了一种更高效、更实用的视觉-语言对抗攻击方法,可替代现有复杂流程,可能降低攻击门槛。蓝队需关注其攻击向量,以改进视觉-语言模型的防御策略。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jung-Woo Chang, Mojan Javaheripi, Seira Hidano, Farinaz Koushanfar
本文首次系统研究了针对基于深度学习的视频压缩与下游分类系统的对抗攻击。视频压缩在视频流媒体和分类系统中至关重要,旨在在有限带宽下最大化用户体验质量(QoE)。作者提出了名为RoVISQ的攻击框架,通过操纵视频压缩模型的率失真(R-D)关系,实现两个目标:(1)增加网络带宽消耗;(2)降低最终用户的视频质量。此外,该框架还设计了针对下游视频分类服务的定向与非定向攻击目标,使分类结果出错。RoVISQ的关键创新在于生成一种输入不变的通用扰动,能够实时且普遍地破坏视频压缩与分类系统,并且与以往攻击不同,该扰动能够抵抗压缩(即攻击效果不会因视频压缩而减弱)。实验在多个视频数据集上进行,结果表明RoVISQ攻击可使峰值信噪比(PSNR)降低高达5.6dB,比特率增加约2.4倍,同时对下游分类器的攻击成功率超过90%。用户研究也证实了攻击对用户QoE的显著影响。此外,RoVISQ在面对对抗训练、视频去噪和JPEG压缩等防御措施时仍表现出鲁棒性。这项工作揭示了深度学习视频压缩系统的安全漏洞,对视频流服务、监控系统和在线视频分类等应用构成实际威胁。
💡 推荐理由: 该研究首次揭示基于深度学习的视频压缩系统存在对抗攻击漏洞,攻击者可通过微小扰动大幅降低视频服务质量、增加带宽成本,甚至干扰下游分类任务,对视频流媒体平台、视频监控等业务构成实际威胁。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Steyn Hommes, Vincent Dankbaar, Tanguy Stekke, Xiaomeng Wang, Lisanne Weidmann, Senna van Hoek, Durba Chatterjee, Lejla Batina, Zhuoran Liu
本文研究了一种跨层级攻击方法,将嵌入式神经网络实现层面的物理故障注入与算法层面的对抗攻击相结合。传统故障注入攻击主要关注通过破坏权重或中间计算导致分类错误,而忽略了与算法级对抗威胁的交互。作者首先通过表征推理期间故障引起的数据扰动,将故障注入与后门学习联系起来,从而能够联合利用实现层和算法层的漏洞。具体而言,提出了一种精确的故障注入方法,能够在执行期间可靠地将目标寄存器值操纵到可预测的状态。利用这种高精度故障注入,提出了一种新颖的端到端特征图层级后门攻击,其中物理诱导的中间扰动作为隐蔽触发器。与传统的基于输入的后门不同,该触发器仅在物理故障下激活,导致神经网络表现出对抗行为,破坏系统完整性,而在正常操作时保持良性。实验在ARM Cortex-M4微控制器(一种常用于受限嵌入式应用的平台)上通过电磁故障注入对卷积神经网络实施,证明了攻击的实用性。结果表明,这种物理触发的后门可以有效规避现有通常假设输入空间触发器的后门防御。该工作强调了在硬件和算法抽象层面交叉处的新攻击向量,需要跨抽象层次的防御。
💡 推荐理由: 本文首次将物理故障注入与算法后门攻击结合,展示了硬件与AI安全交叉的新攻击面,提示现有防御(如输入空间后门检测)可能完全失效。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kwesi Afari Darfoor, Patrick M. Pilarski, Bailey Kacsmar
本文提出了一种名为“idiobionics”的新研究领域,旨在统一隐私保护与智能机器人假肢的发展。随着假肢技术(如仿生肢体)与先进传感器和人工智能控制方法的深度融合,这些设备已演变为半自主可穿戴机器人系统,能够与用户协同适应。然而,这种技术进步也引入了新的威胁向量,可能被恶意行为者利用以侵犯用户隐私。作者认为,要充分实现下一代仿生肢体的益处,必须直接理解和解决这些隐私风险及其对用户采用的障碍。本文首先定义idiobionics,将其置于相关文献中,并通过初步证据展示了可能利用智能假肢设计的潜在对抗性攻击。此外,作者还策划了一份与可穿戴机器人和其他面向人类自主系统研究人员相关的idiobionics开放研究问题清单。论文的核心贡献是开创了这一交叉领域,并为后续研究提供了基础框架和方向。适合可穿戴机器人、隐私安全以及人机交互领域的研究人员阅读。
💡 推荐理由: 随着智能假肢等生物集成设备的普及,用户隐私面临新型威胁。本文首次系统性地定义了idiobionics领域,为后续隐私风险分析与防御研究奠定基础,对推动安全且广泛采用此类技术至关重要。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Paul K. Mandal, Pavan Reddy, Tristan Malatynski
该论文研究了一种新型的视觉模型脆弱性:数据集本身存在的自然统计信号,可以在没有恶意注入的情况下充当类似后门触发器的角色。作者将这种信号称为“统计对手”(statistical adversaries)。与传统的模型特定对抗攻击不同,这些信号是数据分布固有的,而非人为构造。
研究团队以ImageNet为基准数据集,通过相关性分析和统计控制方法,识别出与某些标签存在强关联的视觉模式(例如特定纹理、色彩分布或背景元素)。他们首先筛选出与标签高度相关的候选模式,然后利用统计控制(如偏相关分析)剔除因随机共现而产生的虚假关联,确保所发现的模式具有真实的预测性。随后,通过扰动实验验证:当这些模式出现在模型输入中时,会直接且可预测地改变模型的分类输出,且效果在不同模型架构(如ResNet、ViT)之间具有迁移性。
实验结果表明,这些统计对手比通用的图像损坏(如噪声、模糊)更具针对性,且其影响不依赖于单一模型的训练细节,而是源于数据集的结构和标签分布。论文由此推断:即使在没有蓄意投毒的情况下,普通视觉数据集也可能蕴含可被利用的对抗攻击表面。这暗示,数据集的审计工作不仅应将伪相关性视为偏差或可解释性问题,还应将其视为一种潜在的攻击面。
主要贡献包括:(1)提出了“统计对手”这一概念,将数据集固有模式与后门攻击关联起来;(2)提供了一套识别和验证此类信号的方法论;(3)证明了数据集的统计结构本身就是一种安全风险。该研究适合视觉模型安全研究者、数据集构建者以及希望理解模型鲁棒性基础限制的从业者阅读。
💡 推荐理由: 揭示普通数据集本身可能隐藏类似后门的对抗攻击表面,颠覆了“只有恶意投毒才会引入后门”的固有认知,为模型安全评估和数据集审计提供了新维度。
🎯 建议动作: 纳入内部评估
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas
该论文提出了一种针对视觉语言模型(VLM)的新型后门攻击框架ReShift,其核心创新在于实现推理层面的后门注入,而非传统的输出层操纵。现有后门攻击方法往往在推理链中留下不一致或可检测的痕迹,容易被现有防御机制发现。ReShift通过“顿悟时刻”(aha-moment)驱动的方式,在模型内部思维链(CoT)过程中引导推理轨迹发生偏移,同时保持表面上的逻辑连贯性。框架包含两个关键组件:毒化推理感知数据构建(PRDC)管道,用于生成带有触发条件且推理过程异常的样本;以及监督-强化联合优化(SRJO)策略,用于稳定地诱导触发条件下的推理偏移。论文进一步形式化了“熵反弹”(Entropy Rebound)作为推理重定向的特征信号,并给出一系列理论保证,说明熵缺口与轨迹级差异之间的关系。实验表明,ReShift能够在保持干净任务性能和生成合理推理轨迹的前提下实现高攻击成功率,显著提升对抗现有防御的隐蔽性。该研究揭示了VLM在推理层面存在的安全脆弱性,对构建可信赖的多模态AI系统提出了新挑战。适合AI安全研究员、模型开发人员和防御团队阅读。
💡 推荐理由: 该攻击揭示了VLM推理层面的脆弱性,现有防御难以检测此类隐蔽后门,威胁到安全关键场景中VLM的可信性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Peizhi Niu, Wenjie Qu, Shangding Gu, Tianneng Shi, Yuankai Li, Ahmad Tawaha, Hend Alzahrani, Vincent Siu, Boyi Li, Chenguang Wang, Jiaheng Zhang, Basel Alomair, Ming Jin, Muhao Chen, Chi Wang, Costas Spanos, Dawn Song
该论文针对类似 Claw 的 AI 智能体(如 OpenClaw)的安全问题进行了系统研究。这类智能体是始终在线的进程,持续拥有对凭证、文件、工具和外部服务的访问权限,并承担安装软件包、维护状态、调度子任务、管理 I/O 等系统级职责,因此其安全失效的后果远比其他智能体严重。然而,现有基准测试主要关注模型响应和工具调用,缺乏对跨组件故障模式的评估。作者提出了一个计算机系统类比:将 Claw 类智能体视为一个“智能体计算机系统”,其中网关运行时扮演类似操作系统的中介角色,技能(Skills)类似用户安装的应用程序,插件(Plugins)类似具有运行时特权的可加载扩展。每个组件都有经典的安全保护机制,但智能体侧缺乏这些机制。基于这一视角,作者开发了 SafeClawArena 基准测试,包含 406 个对抗性任务,覆盖四个攻击面:技能供应链完整性、持久状态利用、跨边界数据流和间接提示注入。该基准测试在真实智能体平台的容器化副本中执行,使用金丝雀标记的凭证,并通过九个输出通道的自动污点跟踪进行评估。作者评估了三个平台(OpenClaw、NemoClaw、SeClaw)和五个前沿 LLM。最高攻击成功率达到 70%;恶意插件在所有情况下都 100% 成功,无论使用哪个 LLM。SeClaw 平台将 GPT-5.4 的攻击成功率从 70% 降低到 22%,部分是通过效用-安全权衡而非主动防御实现的,而 Claude-Opus-4.6 在每个平台上都已接近 22% 的底线。这些结果暴露了当前防御的不足,并指出了未来加固的方向。
💡 推荐理由: 该研究首次从计算机系统视角系统评估了 Claw 类智能体的安全性,揭示了现有防御的严重不足,为构建更安全的自主 AI 智能体提供了基准和方法论指导。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jinhao You, Zan Zhou, Shujie Yang, Yi Sun, Lei Zhang, Changqiao Xu
本文针对网络流量检测中的对抗攻击问题展开研究。当前基于深度神经网络(DNN)的网络入侵检测系统(NIDS)虽然准确率高,但极易受到对抗样本的攻击。现有方法多从计算机视觉(CV)领域直接迁移对抗攻击技术,忽略了CV与NIDS之间的根本差异,导致两大问题:1)生成的网络流量可能因不满足协议规范而无效;2)生成的流量可能丢失原始攻击语义,即攻击效果不再存在。为解决这些问题,本文提出了一种专门面向NIDS的对抗攻击方法PLAA(Packet-Level Adversarial Attacks)。该方法不直接生成流级特征,而是逐步增量地生成包级特征来构建对抗流量。在生成过程中,每一阶段都监控流量的语义完整性,从而有效避免无效流量和语义丢失。作者在CIC-UNSW-NB15、CIC-DDoS2019和CIC-IDS-2017三个数据集上,针对当前主流NIDS模型进行了评估。实验结果表明,所提方法平均绕过成功率达92.78%,且能保证生成的对抗流量与原恶意流量在语义上一致。该工作揭示了现有NIDS在对抗攻击下的脆弱性,对防御者具有预警意义。
💡 推荐理由: 该研究揭示了当前基于DNN的NIDS在面对特定构造的对抗流量时存在高达92.78%的绕过率,且生成的流量保持语义有效,这对网络安全防御者具有直接的警示作用。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuhang Jiang, Xiaojing Chen
本文揭示了在基于迁移的对抗攻击中,输入多样性(Input Diversity, DI)这一常用技巧对攻击迁移性的影响存在非单调的“剪刀效应”。DI通过在每次攻击迭代中对输入图像进行随机缩放和填充来增强攻击的鲁棒性,通常被认为能普遍提高迁移成功率。然而,作者发现这一假设依赖于目标模型的类型:对于标准训练的代理模型,增加DI概率确实提升迁移成功率;但对于经过鲁棒训练的代理模型,DI反而显著降低迁移成功率,两者的响应曲线像剪刀一样分离。在ImageNet数据集上,盲目使用DI导致针对CNN、ViT、Swin和ConvNeXt等目标模型,以及2018至2024年间十种攻击的平均攻击成功率下降10.3%。在CIFAR-10上该效应较弱,除非DI强度较大。通过控制鲁棒性强度的实验表明,这种损害是渐进的而非二元的,在弱鲁棒性区域就已出现转折。作者将原因追溯到梯度几何:通过缩放/平移分解,约67%的损害归因于缩放操作;直接测量源-目标梯度对齐发现,相同缩放操作对标准代理改善对齐,对鲁棒代理则恶化对齐。作者提出局部梯度一致性(Local Gradient Consistency, LGC)指标来区分两种代理类型,并证明了一个偏差-方差交叉定理,隔离了DI有益的区间与缩放偏差占主导的区间。最后,提出无需重新训练的策略CG-DI,即当LGC高时禁用DI,从而保留标准代理上DI的益处并避免鲁棒代理上的损失。这项工作将剪刀效应定位为更广泛的鲁棒性-迁移性权衡在DI上的具体表现。
💡 推荐理由: 对抗攻击的迁移性是评估防御鲁棒性的关键指标。本文发现广泛使用的输入多样性技巧在鲁棒模型上反而有害,这一反直觉结果将影响攻击评估和防御设计的实践,值得安全研究人员重新审视攻击算法的默认设置。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: De Zhang Lee, Han Fang, Ee-Chien Chang
本文针对黑盒对抗攻击的流式检测(Stateful Detection, SD)方法展开研究。现有方法如Blacklight和PIHA利用查询之间的相似性来识别对抗性查询序列。作者观察到,分类软标签的时间相关性是对抗攻击的一个显著特征,可用于降低误报率。此外,论文指出SD实现中的一个潜在漏洞:许多系统为了效率采用近似相似函数替代精确但计算昂贵的度量,攻击者可以构造在近似下不相似但在精确度量下相似的查询,从而逃避检测(称为针对近似函数的“对抗攻击”)。基于这些观察,作者提出一个两阶段检测框架:第一阶段识别高相似度的查询子序列,并引入随机性以防止针对近似函数的对抗攻击;第二阶段分析软标签的时间相关性,进一步验证是否存在攻击者查询。实验结果表明,该方法对Boundary Attack、HSJA、SimBA、Square Attack等攻击的检测真阳性率(TPR)达到1.00,同时假阳性率(FPR)不超过0.06,并且对自适应攻击OARS具有鲁棒性。
💡 推荐理由: 该研究改进了对抗攻击的流式检测方法,利用软标签时间相关性降低误报,并揭示了近似相似函数可能被利用的漏洞,对提升检测系统鲁棒性有重要意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: R. Spencer Hallyburton, Miroslav Pajic
本文首次揭示了一种针对 LiDAR 传感器的远程触发恶意软件攻击面。作者发现,可以预先将恶意软件嵌入 LiDAR 固件中,在正常运行时保持休眠状态,部署后无需物理接触或网络访问即可通过外部光信号远程激活。研究团队在封闭研究环境(有厂商技术支持)中开发了能够实时操纵点云的恶意软件,并设计了一种光学触发器,通过向感知环境发射调制信号来触发激活。触发后,恶意软件可以执行虚假对象注入(例如凭空生成行人轮廓)和真实对象抑制(例如擦除真实障碍物)。实验在静态(300英尺距离)和动态(35英里/小时)场景中验证了攻击可行性,并通过 SOTA 3D 目标检测器确认注入的类人伪影在语义上可被检测。最后在战术自主车辆上演示了多种安全关键影响(如碰撞规避失败)。论文强调,当前 LiDAR 开发与部署流程缺乏完整的完整性保障,尤其是在固件层面。适合自动驾驶安全研究人员、传感器固件开发者和系统安全架构师阅读。
💡 推荐理由: 该攻击无需传统网络或物理访问,仅通过光学远程触发即可操纵 LiDAR 感知结果,直接威胁自动驾驶系统的安全决策,揭示了感知管线供应链中固件完整性的盲区。
🎯 建议动作: 跟进论文,评估自身 LiDAR 供应链的固件签名与完整性校验机制,调研光学异常信号检测方案。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Bohdan Turbal, Blossom Metevier, Max Springer, Aleksandra Korolova
本文提出了一种名为Greedy Coordinate Diffusion (GCD)的新型对抗攻击框架,用于攻击经过安全对齐的大型语言模型(LLM)。现有攻击方法存在两类问题:基于优化的攻击(如GCG)生成高困惑度、不连贯的后缀,容易被基于困惑度或防护模型的过滤器检测;而保持语义连贯的攻击往往改变查询的语义意图,导致模型响应偏离攻击者的原始目标。GCD利用离散扩散语言模型的生成先验来引导对抗后缀的搜索,在保持低困惑度和高语义一致性的同时实现高效攻击。该方法无需直接梯度访问,可在灰盒设置下运行。实验表明,GCD在攻击成功率(ASR)上达到最高,同时在响应质量得分上具有竞争力,且构造的对抗提示被基于困惑度和防护模型的过滤器检测到的比率低于其他方法。该工作揭示了安全对齐LLM面临的语义连贯对抗攻击风险,为防御研究提供了新的评估基准。
💡 推荐理由: 该工作展示了现有对抗攻击的检测机制可能被更隐蔽的攻击绕过,强调了需要开发对低困惑度、语义连贯攻击更鲁棒的防御手段。
🎯 建议动作: 研究跟进,评估内部LLM部署对此类攻击的脆弱性,并探索针对性防御。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Peng Cheng 0007, Yuwei Wang 0009, Peng Huang, Zhongjie Ba, Xiaodong Lin 0001, Feng Lin 0004, Li Lu 0008, Kui Ren 0001
该论文聚焦于语音可控智能设备面临的对抗样本(AE)威胁。已有黑盒对抗攻击仅需目标ASR系统最终转录结果,但通常需要大量查询,成本高昂,且对抗样本易受ASR模型更新影响。作者指出根本原因在于无法直接在深度学习模型决策边界附近构造对抗样本。基于此,提出ALIF,首个基于语言学特征的黑盒对抗攻击管道。ALIF利用文本-语音(TTS)和ASR模型的互逆过程,在决策边界所在的语言学嵌入空间中生成扰动。基于ALIF管道,进一步提出ALIF-OTL和ALIF-OTA两种方案,分别针对数字域和物理播放环境,在四个商业ASR和语音助手上进行攻击。大量评估表明,ALIF-OTL和ALIF-OTA的查询效率分别比现有方法提升97.7%和73.3%,且攻击性能相当。尤为突出的是,ALIF-OTL仅需一次查询即可生成攻击样本。时间鲁棒性实验验证了该方法对ASR模型更新的抵抗能力。该研究揭示了低成本、高效的黑盒音频对抗攻击途径,对语音平台安全性构成新挑战。
💡 推荐理由: 本文展示了极低成本的黑盒音频对抗攻击,仅需一次查询即可生成有效样本,且对ASR更新鲁棒,提醒防御者此类攻击可能对语音助手和ASR服务造成严重威胁,需关注语言学层面的防御。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot
该论文对多模态大语言模型(MLLMs)的推理时防御方法进行了比较实证评估。背景:MLLMs在安全关键场景中应用增多,但视觉通道使其易受对抗攻击,而主要面向文本的安全对齐只能部分应对。重新训练模型以适应每种新漏洞类成本过高。因此,研究聚焦于推理时防御。方法:在InternVL和Qwen-VL系列共8个模型上,针对4种攻击类别、7个安全基准、总计9000个评估样本,评估了三种推理时防御方法(安全提示、SmoothVLM、以及它们的组合)的效果。使用统一的代理分类器进行评估。主要发现:1)没有单一防御在所有设置中占优,效果取决于模型基线安全水平和攻击类型。2)直接组合防御会导致良性查询的过度拒绝率高达97-100%,而单独SmoothVLM也达99.2-100%。3)简单的安全提示能保持大部分效用(过度拒绝率0.0-18.2%,其中5个模型低于7%,两个超过15%),同时带来中等安全性提升。4)不同攻击类在不同的基准下暴露出不同弱点,凸显了多基准评估的重要性。5)在两项模型的初步白盒测试(n=20)中,文本级防御抑制了原本无防御时成功的PGD视觉攻击:防御作用于输出阶段,梯度优化在该配置下影响有限。结论:结果支持自适应防御选择而非单一固定防御配置。适合安全研究人员、LLM开发者和部署者阅读。
💡 推荐理由: 多模态大模型安全防护是当前热点,该研究系统比较了多种推理时防御方法的实际效果与权衡,为实际部署提供了选择指导。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lingfeng Yao, Xincong Zhong, Chenpei Huang, Xuandong Zhao, Hanqing Guo, Aohan Li, Jiang Liu, Tomoaki Ohtsuki, Miao Pan
随着AI生成音频的普及,水印技术被广泛用于检测滥用和保护知识产权。然而,攻击者可能试图移除这些水印,因此评估水印方案对移除攻击的鲁棒性至关重要。现有攻击方法往往不切实际:要么明显降低感知质量,要么需要访问水印方案的具体细节。本文提出DiffErase,一种黑盒水印移除攻击方法,它假设攻击者不了解目标水印方案,同时保持感知质量。DiffErase将带水印的音频扰动到中间扩散噪声水平,然后使用预训练的降噪模型重新生成,从而有效抑制水印信号。理论分析和大量实验表明,不可听的音频水印非常脆弱:在多个音频域中,DiffErase在保持感知质量的同时持续移除水印。这些发现突显了未来音频水印设计需要考虑基于扩散模型的威胁。代码和演示可在 https://differase.github.io/DiffErase/ 获取。
💡 推荐理由: 揭示了当前音频水印在扩散模型攻击下的脆弱性,对安全从业者评估和保护音频内容水印系统具有警示意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zisis Tsiatsikas, Alexandros Fakis, Georgios Karopoulos, Vasileios Kouliaridis, Marios Anagnostopoulos
本文是首篇针对设备端AI推理(on-device AI inference)安全威胁与防御机制的系统综述。随着越来越多的预训练AI模型被部署在移动设备和边缘设备上进行客户端推理,模型窃取/提取、对抗性攻击和数据泄露等风险日益突出。现有防御机制包括可信执行环境(TEE)、同态加密、混淆和差分隐私等,但当前综述多聚焦于边缘智能(含分布式训练),忽略了设备端推理特有的安全与隐私问题。本文系统梳理了针对设备端推理的攻击和防御文献,发现攻击与防御研究极不平衡:约四分之一的攻击论文关注知识产权(IP)攻击,而一半的防御方案针对同一问题;更关键的是,某些攻击类别(如占攻击文献约三分之一的对抗性攻击)尚无对应的防御研究。这一不对称性凸显了未来研究的方向。本文适合安全研究人员、AI系统开发者和边缘计算从业者阅读。
💡 推荐理由: 首次系统梳理了设备端AI推理特有的攻击与防御,揭示了当前防御严重落后于攻击的不对称局面,为后续研究提供了清晰的路线图。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Miel Verkerken, Laurens D'hooge, Bruno Volckaert, Filip De Turck, Giovanni Apruzzese
本文针对基于机器学习的网络入侵检测系统(ML-NIDS)的对抗鲁棒性研究提出关键反思。现有大量工作通过向预收集的数据点(如路由器捕获的数据包或ML-NIDS分析的网络流)施加微小扰动来评估ML-NIDS的安全性,但作者指出,真实攻击者只能控制网络中少数无特权的主机,其扰动施加范围受限于主机层面(即“host-space”)。通过系统文献综述(n=316),作者发现先前研究大多忽略了这一约束,其扰动操作可能超出攻击者实际能力。为填补这一空白,本文正式定义了“主机空间对抗扰动”,即攻击者仅通过修改自身可控主机上的行为(如改变SSH暴力破解命令字符串中的一个字符)来产生对抗样本。实验基于公开基准和真实网络,结果表明:能够检测特定命令字符串SSH暴力尝试的ML-NIDS,当攻击者将该字符串仅修改一个字符后,完全无法检测任何后续尝试。作者进一步分析了这种问题空间(主机)微小变化如何导致特征空间的灾难性影响,并总结了评估主机空间扰动的实践教训。本文呼吁重新评估ML-NIDS的安全性,强调应从攻击者可操作的真实主机视角进行鲁棒性测试。
💡 推荐理由: 指出当前ML-NIDS对抗鲁棒性评估中的核心方法论缺陷:多数工作假设攻击者可操控网络流量数据,而真实攻击者仅能控制主机行为。重新定义评估边界有助于更贴近实战,避免模型安全性误判。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Linyi Li 0001, Maurice Weber, Xiaojun Xu, Luka Rimanic, Bhavya Kailkhura, Tao Xie 0001, Ce Zhang 0001, Bo Li 0026
本文提出TSS(Transformation-Specific Smoothing)框架,旨在为机器学习模型提供针对语义变换(如旋转、模糊、平移等)的鲁棒性认证。现有认证方法主要针对L_p范数约束的扰动,而对语义变换的认证研究不足。TSS根据语义变换的特性将其分为两类:可解析变换(如高斯模糊)和差分可解析变换(如旋转),针对前者提出变换特定随机平滑策略,针对后者采用分层采样方法以处理插值误差。TSS结合一致性增强训练,实现了严格的鲁棒性认证。实验在十多种挑战性语义变换上进行,结果表明TSS显著优于现有方法,并且首次在大规模ImageNet数据集上取得非平凡的认证鲁棒性(例如,在±30°旋转攻击下实现30.4%的认证准确率)。此外,TSS对自适应攻击和未知图像损坏(如CIFAR-10-C、ImageNet-C)也具有鲁棒性。
💡 推荐理由: 该研究填补了语义变换鲁棒性认证的空白,为安全攸关的ML系统(如自动驾驶、医疗影像)提供了可证明的防御保障。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Wei Song, Cong Cong 0001, Haonan Zhong, Jingling Xue
本文提出了一种基于修正的防御方法,旨在抵御针对视频分类模型的对抗性攻击。该方法利用离散化增强视频压缩感知(DVCS)技术,将视频压缩采样与离散化处理相结合,以消除对抗性扰动。核心思想是:对抗性扰动通常表现为高频噪声,而视频压缩感知的欠采样过程可以有效滤除这些噪声;进一步通过离散化(如量化)破坏扰动的结构。作者设计了一个端到端的防御框架,包括压缩采样、离散化、重构和分类步骤。实验在多个视频数据集(如UCF-101、HMDB-51)上评估,针对多种攻击(如FGSM、PGD、C&W)展示了较好的鲁棒性提升,同时保持了较高的分类准确率。与现有的对抗训练、输入变换等方法相比,该方法在计算开销和防御效果之间取得了平衡。此外,作者还探讨了离散化参数对性能的影响,并给出了理论分析。该工作为视频领域的对抗防御提供了新思路,适合对视频安全、对抗学习感兴趣的研究者阅读。
💡 推荐理由: 视频对抗攻击防御是安全领域的重要课题,该方法无需对抗训练即可提升鲁棒性,且计算开销较低,有实际部署潜力。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Buyun Liang, Jinqi Luo, Liangzu Peng, Kwan Ho Ryan Chan, Darshan Thaker, Kaleab A. Kinfu, Fengrui Tian, Hamed Hassani, René Vidal
本文针对大型语言模型(LLM)中的幻觉现象,提出了一种新颖的对抗性攻击框架REALISTA。幻觉是指模型生成看似合理但实际错误的内容,严重影响LLM的可靠性和安全性。现有攻击方法存在局限性:基于离散提示的攻击(如人工改写)搜索空间有限,而连续潜在空间攻击虽然探索空间更大,但解码后的提示往往失去语义等价性,无法保证与用户正常提示的等效性。REALISTA将幻觉诱导形式化为一个约束优化问题,旨在找到与良性用户提示语义等价且连贯的对抗性提示。其核心创新在于构建了一个输入相关的有效编辑方向词典,每个方向对应一个语义等价且连贯的改写,然后在潜在空间中优化这些方向的连续组合。这种方法结合了连续攻击的优化灵活性和离散改写攻击的语义真实性。实验表明,REALISTA在多个开源LLM上达到或超越了现有最先进现实攻击的效果,并且成功攻击了大型推理模型(如Chain-of-Thought模型)的自由响应设置,而此前的方法在此场景下均失效。该工作揭示了LLM在面对精心设计的对抗性提示时仍存在严重的幻觉漏洞,为评估和提升LLM的安全性提供了重要工具。
💡 推荐理由: 该研究揭示了LLM在面对语义等价的对抗性提示时仍可能产生幻觉,有助于安全从业者理解模型脆弱性,并开发更鲁棒的防御机制。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)