#vision-transformer

共收录 9 条相关安全情报。

← 返回所有主题
👥 作者: Stefano Leggio, Giulio Rossolini, Alessandro Biondi

本文针对视觉 Transformer (ViT) 在分割推理(split inference)场景中的隐私泄露问题展开研究。在分割推理中,边缘设备将中间 token 表示发送给远程云端进行处理;这一过程中,通常采用 token 减少(token reduction)来降低计算与通信开销,以及 token 乱序(token shuffling)来破坏 token 的空间组织,从而可能减少信息泄露。然而,这些机制在特征反转攻击(feature inversion attack)下的实际隐私保护效果尚不清楚。作者发现,尽管乱序扰乱了传统重建攻击所需的空间结构,但所传输的 token embedding 中仍保留了丰富的位置信息。基于这一观察,作者提出了一种名为 SARA(Spatially Aligned Reconstruction Attack)的统一攻击流程,它通过预测原始 token 的位置并恢复其空间布局,再利用特征空间掩码自编码器重建被删除的 embedding,最终重构出原始输入图像。实验结果表明,token 乱序仅提供表面上的隐私,因为 SARA 能高保真地恢复 token 排列;token 减少提供了相对更强的保护,但保留的 token 若携带充分的语义和位置信息,仍然存在显著的泄露风险。为缓解此类风险,作者进一步提出了一种轻量级的边缘侧防御方案:在边缘端移除 positional embeddings,并通过知识蒸馏让边缘侧的 transformer 块逐步适应这种变化。该防御显著降低 SARA 的攻击性能,同时保持下游任务精度,且无需修改云端模型。论文揭示了分割推理中位置信息泄露的隐患,并提供了具有实用价值的防御方向。

💡 推荐理由: 该研究证明 token 乱序几乎不能保护 ViT 分割推理的输入隐私,边缘节点必须重新评估其已有的防御假设。所提出的轻量级防御可直接为实际推理系统提供可落地的加固方案,提醒模型部署方在传输中间特征时注意位置编码泄露。

🎯 建议动作: 研究跟进并纳入内部评估:针对使用 ViT 做分割推理的系统,进行隐私泄露测试,并考虑采用论文提出的防御方案进行加固。

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Kurt M Wilson, Mohaiminul Al Nahian, Abeer Matar A. Almalky, Sadat Shahriyar, Souvik Kundu, Zhishan Guo, Abdullah Al Arafat, Adnan Siraj Rakin

本文提出 TEE-X,一个面向可信执行环境(TEE)的加速框架,旨在解决大型视觉模型(如 Vision Transformer, ViT)在边缘设备上部署时面临的内存限制和计算延迟问题。研究背景是:机器学习模型,尤其是视觉应用,容易受到多种安全威胁;白盒与黑盒威胁模型的差异影响攻击有效性。使用 TEE 可以通过保护模型机密性和执行完整性,将执行环境从白盒侧转移到黑盒侧,从而增强安全性。然而,将大型视觉模型完全放入 TEE 会带来显著的内存和延迟开销,尤其在安全性和隐私至关重要的实时边缘应用中。TEE-X 的核心方法包括:1) 灵敏度感知的模块化技术,将模型分解为不同敏感度级别的模块,以实现更精细的 TEE 内执行;2) 在 TEE 推理中引入向量化,提高计算效率。该框架在 OP-TEE(Arm TrustZone)上实现,并在 NVIDIA Jetson AGX Xavier 上针对 ViT 模型进行了性能优化。实验结果表明,TEE-X 能够在保证模型准确性和低延迟的前提下,实现安全快速的边缘推理,有效平衡了精度与性能。该工作为在资源受限的边缘设备上安全部署大型视觉模型提供了一种可行的加速方案。适合对 TEE、边缘 AI 安全、模型机密性和性能优化感兴趣的研究人员和工程师阅读。

💡 推荐理由: 为边缘端大视觉模型提供TEE内高效推理方案,在保障模型机密性与执行完整性的同时缓解延迟瓶颈,对自动驾驶、医疗影像等实时安全敏感场景有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Homare Sueyoshi, Kiyoshi Nishikawa, Hitoshi Kiya

本文提出了一种面向视觉Transformer(ViT)目标检测模型的隐私保护方法。以往针对视觉信息保护的研究主要集中于图像分类任务,而本文首次将感知加密(perceptual encryption)技术应用于目标检测任务。该方法利用ViT的嵌入结构以及基于密钥的域适应技术,使得在加密测试图像的同时,目标检测模型仍能保持与未保护模型几乎相同的精度。实验采用基于ViT的目标检测模型ViTdet,验证了该方法在精度和视觉保护两方面的有效性。具体而言,感知加密在保留目标检测所需的结构信息的同时,扰乱了视觉上的敏感内容,从而防止未授权方从图像中直接获取隐私信息。本文的研究为在云端或边缘端部署目标检测服务时保护用户图像隐私提供了一种可行方案,适合从事隐私保护机器学习、视觉Transformer应用以及安全计算机视觉研究的人员阅读。

💡 推荐理由: 目标检测在监控、自动驾驶等场景中常处理敏感图像,本文首次将感知加密扩展到ViT目标检测,为隐私保护与模型精度兼顾提供了新思路,值得关注视觉隐私的研究者参考。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Anadi Goyal, Nandish Chattopadhyay, Chandan Karfa, Anupam Chattopadhyay, Norrathep Rattanavipanon

视觉Transformer(ViTs)在资源受限环境中常通过token剪枝技术来降低计算成本并保持准确率,然而攻击者可针对这些剪枝机制发起对抗性效率攻击,故意构造输入以破坏剪枝的收益,导致模型推理开销剧增,违背了效率优化的初衷。本文提出了一种名为MOAT(Model-Agnostic Randomized Transformations)的模型无关预处理防御管线,通过组合多种输入变换来保护采用token剪枝的ViT实现免受此类效率攻击。MOAT直接作用于输入,无需修改模型架构或token剪枝逻辑,因此可集成到现有部署流程中。实验结果表明,在所有测试的ViT模型上,MOAT能将对抗攻击下的GFLOPs退化限制在原始无攻击模型的3.4%以内,显示了其有效的防御能力和普适性。该研究为在资源受限场景下安全部署高效ViT提供了实用方案,适合关注AI系统安全性与鲁棒性的研究者和工程师阅读。

💡 推荐理由: 效率攻击可让token剪枝等优化形同虚设,造成推理延迟剧增,影响实时服务和边缘部署的可用性。MOAT提供一种无需改动模型的输入预处理防御,可直接集成,为防御此类拒绝服务式攻击提供新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Anadi Goyal, Nandish Chattopadhyay, Anupam Chattopadhyay, Chandan Karfa

本文对视觉 Transformer(ViT)在输入自适应推理机制下的对抗性效率下降攻击进行了系统综述。近年来,ViT 为满足能源与延迟约束,广泛采用 token 剪枝、提前停止等输入自适应技术,但这些优化同时引入了新的攻击面。攻击者可通过精心构造的输入扰动,迫使模型保留更多计算开销,从而导致推理效率显著下降,而无需牺牲分类精度。该综述统一比较了两种代表性攻击:SlowFormer(通用对抗补丁)与 DeSparsify(逐图像扰动),并分别在三种主流 token 剪枝框架(A-ViT、ATS、AdaViT)下进行实验评估。为了标准化评估,作者采用 GFLOPs、准确率损失以及攻击成功率(AS)指标衡量攻击所移除的模型计算节省比例。通过回答三个核心问题,即输入自适应优化如何构成攻击面、攻击在实际中如何运作且哪些优化最脆弱、以及现有防御能否在攻击下有效恢复效率,本文梳理了攻击与防御的当前研究格局。结果表明,效率下降攻击对依赖动态计算的部署场景构成实际威胁,尤其对移动和嵌入式等低功耗设备影响显著。文章同时指出,设计轻量级且有效的防御策略是重要且亟待解决的研究方向,为后续工作提供了理论框架和建议。

💡 推荐理由: 该综述揭示了针对 ViT 动态推理机制的新型攻击面,这类攻击不必破坏精度,仅通过增加计算开销即可造成拒绝服务或能源浪费,对边缘智能设备的安全部署构成实际威胁。安全从业者需理解此类攻击原理,以便在模型设计和部署中纳入相应防护。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tianyi Wang, Zhenghao Gao, Shengjie Xu

本文提出一种名为 Season 的频谱感知正交梯度细化框架,用于提升基于迁移的对抗样本攻击在异构模型间的迁移性。研究背景是:卷积神经网络(CNN)偏向于利用局部纹理特征,而视觉Transformer(ViT)依赖全局形状特征,导致在CNN上生成的对抗样本迁移到ViT等架构时攻击成功率显著下降。Season 在白盒替代模型上生成针对黑盒目标模型的 L-infinity 对抗扰动,其核心思路是将每次梯度更新分解为低频分支(捕捉结构线索)和高频分支(捕捉纹理线索)。通过低显著性引导机制,将高频能量重新分配到图像背景区域,从而保护ViT所依赖的前景结构。随后,利用正交投影迫使纹理更新位于结构方向的互补子空间,以缓解特征干扰。Season 是一种无需训练、即插即用的包装模块,可直接增强八种现有的梯度稳定化和输入增强攻击方法,而不修改其核心逻辑。在 ImageNet 数据集上,针对八个不同的CNN、ViT和MLP目标模型,Season 在统一协议下使迁移攻击成功率平均提升6.6个百分点,最高提升16.0个百分点。本文主要贡献在于提出一种模型无关、计算开销小的通用增强框架,揭示了跨架构迁移中频谱与正交性的作用。适合对抗攻击与防御研究者、模型鲁棒性评测人员以及安全厂商的红队测试工程师阅读。

💡 推荐理由: 对抗样本迁移性是评估模型鲁棒性的关键维度,Season 揭示了跨架构攻击失败的结构性原因,并提供通用增强方法,有助于防御方理解黑盒攻击能力边界,改进模型集成与防御策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Guang Yang, Fengchen Liu

本文提出了一种名为GLID(Gated Local Intrinsic Dimension)的人脸伪造检测方法,旨在解决现有基于微调基础模型的检测器对未见过的生成器家族(如GAN或扩散模型生成的图像)检测能力不足的盲点问题。传统检测器在训练时仅接触部分生成器家族,导致对新型伪造手段的泛化能力差。GLID摒弃了依赖大量训练数据的思路,转而利用图像的几何特性。具体而言,该方法将单个图像的补丁令牌视为嵌入在高维空间中的流形采样,并在冻结视觉Transformer(ViT)的多个深度层中估计其局部内在维度(LID)。由此产生的12维信号无需额外训练,通过一个置信度门控机制注入到微调检测器中,该门控的强度仅基于分布内数据校准。在16轴跨生成器基准测试中,GLID取得了0.805的平均AUC,在所有重新训练的最新基线中排名第一,且在所有轴上从未显著落后于最强基线。它使得生成轴(即伪造图像)的AUC提升了0.084,而重演轴(如面部动作迁移)仅下降了0.005。论文还揭示了两个经验定律:(1)伪造图片会在特定深度扭曲令牌流形:GAN伪迹在最后一层达到峰值,扩散伪迹在中间网络层达到峰值,且该模式在四种骨干网络、三种维度估计器和非人脸图像中持续存在;(2)微调仅在训练数据覆盖的位置吸收辅助增益:注入1%的目标家族图像会抹去0.100的增益提升,因此几何信号在数据不可用的情况下至关重要。此外,该确定性信号将准确率的跨种子方差降低了5.5倍。代码、预注册分析门控和逐图像评分均随论文公开。

💡 推荐理由: 该方法为跨生成器家族的人脸伪造检测提供了无需额外训练数据的几何解决方案,显著提升了泛化能力,对于防御方应对未知伪造手段具有重要价值。

🎯 建议动作: 研究跟进,评估GLID方法在现有检测管道中的应用潜力。

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xiaoyun Xu, Shujian Yu, Zhuoran Liu 0001, Stjepan Picek

本文针对视觉 Transformer(ViT)在对抗攻击下的脆弱性展开系统研究。ViT 已成为现代视觉-语言模型的基础架构,但其对抗鲁棒性不足,需要专门的对抗训练(AT)策略。作者首先指出现有最先进的 AT 方法(如 Generalist 和 DBAT)与 ViT 存在显著不兼容性。接着,论文从互信息(MI)角度进行理论分析,证明在基于自编码器的自监督预训练中,对抗样本与其潜在表示之间的互信息应通过导出的 MI 界限进行约束。基于此洞察,作者提出一种自监督 AT 方法 MIMIR,该方法通过掩码图像建模和自编码器,引入互信息惩罚项来增强对抗预训练。在 CIFAR-10、Tiny-ImageNet 和 ImageNet-1K 上的大量实验表明,MIMIR 能够持续提升自然准确率和鲁棒准确率,在 ImageNet-1K 上全面超越现有最先进方法。此外,MIMIR 对未知攻击和常见损坏数据表现出卓越的鲁棒性,还能抵御完全知晓防御机制的自适应攻击。代码和训练模型已开源。本研究适合对抗机器学习、视觉安全领域的研究人员和工程师阅读。

💡 推荐理由: ViT 在视觉任务中广泛应用,但对抗鲁棒性不足。MIMIR 提供了一种新的自监督对抗训练范式,通过互信息约束显著提升了鲁棒性,且对未知攻击有效,具有重要实践价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tatsuya Chuman, Yousuke Udagawa, Hitoshi Kiya

该论文提出了一种隐私保护的衣物分类方案,旨在实现安全的人员中心控制(OCC)系统。尽管利用摄像头图像进行暖通空调(HVAC)控制以优化热舒适度的研究已广泛开展,但先前的工作未考虑对居住者图像的隐私保护。虽然已有多种隐私保护方法被提出用于图像分类,但应用传统方案会导致严重的精度下降。本文引入了一种基于Vision Transformer(ViT)的隐私保护分类方法,应用于衣物隔热估计。在根据衣物隔热类别标注的DeepFashion数据集上的实验表明:传统的基于像素的方法遭受严重的精度下降,而本文方案在加密图像上保持高精度,在所有类别上均未出现相比明文图像的精度退化。该研究适合于从事智能建筑、隐私保护机器学习、计算机视觉以及暖通空调控制的研究人员和工程师阅读。

💡 推荐理由: 该研究为智能建筑中的人员控制提供了隐私保护方案,解决了摄像头图像用于热舒适控制时的隐私泄露问题,且保持了高分类精度。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)