#model-security

共收录 9 条相关安全情报。

← 返回所有主题
👥 作者: Roberto Riaño, Gorka Abad, Stjepan Picek, Aitor Urbieta

该论文研究的是「潜在世界模型(Latent World Model)」在复用场景下暴露出的供应链后门风险。世界模型是一类学习式模拟器:把观测编码为潜在状态,并预测在给定动作下状态如何演化。当前社区开始像复用预训练编码器和语言模型那样,把预训练世界模型直接当作「开箱即用」的动力学骨干网络,用于下游控制任务(如 Dreamer 风格的想象式 actor 训练,或基于预测未来的 MPC/CEM 规划)。作者指出,这种复用模式引入了一条新的供应链攻击路径:攻击者只需控制一个对外发布的模型检查点,就能劫持下游控制器——而受害者全程在干净数据上训练与评估,从未见过触发器。 该攻击的关键创新在于不编码任何显式的「触发器→动作」规则。相反,被投毒的世界模型会把携带触发器的观测路由到潜在空间中某个选定区域,并重塑该区域的局部动力学,使得受害者自身的优化过程(想象式 actor 训练或规划搜索)自行「重新发现」攻击者预设的目标动作。这样后门与受害者算法解耦,不依赖特定控制器实现。 实验覆盖多个控制任务与多类触发器族。结果表明:触发器能把控制器动作导向攻击者目标,可控制全部动作维度,在最强设置下能劫持 100% 的触发步。同时该检查点仍能通过受害者在部署前常规运行的干净数据诊断,干净任务成功率至少保留约 75%。效果具有时间门控特性:仅在触发器存在时出现,触发器移除后即消失。作者还发现「触发器盲」的修复手段受预算制约:适度的干净微调能保住干净任务效用,但触发失败依然存在;只有足够激进的适配才能消除后门,代价是干净控制性能显著下降。结论是,世界模型骨干正成为一个新兴且被严重忽视的控制系统攻击面,论文代码与工件已开源。该工作适合从事具身智能、强化学习安全、AI 供应链与模型后门检测的研究者与工程师阅读。

💡 推荐理由: 预训练模型复用已成主流工程实践,而世界模型作为控制系统的动力学骨干,其检查点一旦被投毒即可在受害者未见触发器的情况下劫持下游控制器,且能通过常规干净数据验收。这提示模型供应链审计与部署前评估需要覆盖潜在动力学层,而非只看任务成功率。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 11.5
Conf: 50%
👥 作者: Kang Yang, Guanhong Tao 0001, Xun Chen, Jun Xu 0024

本文研究大型语言模型(LLM)在微调过程中对齐(alignment)能力意外丧失的问题。尽管对齐训练可以促使模型拒绝回答不道德或有害的问题,但当模型针对下游任务进行微调时,这种对齐可能被削弱,导致模型再次输出有害内容。作者观察到,一个经过对齐的LLM内部存在两个相反的方向:对齐方向和有害方向。模型倾向于沿对齐方向回答问题,而拒绝沿有害方向的查询。因此,他们提出一种恢复方法:通过梯度下降,从原始对齐模型中恢复微调模型的一部分权重参数,以重建被削弱的有害方向。同时引入回滚机制,避免过度恢复并保持下游任务性能。作者在125个微调后的LLM上进行评估,结果表明该方法能将有害率(回答有害问题的百分比)从33.25%降至1.74%,且几乎不牺牲任务性能。相比之下,现有方法要么只能有限地降低有害率,要么显著影响正常功能。代码已开源。

💡 推荐理由: LLM微调是常见工程实践,但可能意外破坏安全对齐。该研究提供了一种低成本的修复方案,能帮助防御者在保持模型功能的同时恢复安全性,对实际部署LLM的蓝队和模型安全工程师有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jiangyi Deng, Shengyuan Pang, Yanjiao Chen, Liangming Xia, Yijie Bai, Haiqin Weng, Wenyuan Xu 0001

本文提出了一种名为 Sophon 的新型保护框架,旨在防止预训练模型被恶意微调到不道德或非法的下游任务(如隐私推断、不安全内容生成),同时保持模型在原始任务上的性能。作者将这一目标定义为“非微调学习”(non-fine-tunable learning),即让模型具有抵抗特定受限域内微调的能力。核心挑战在于攻击者可能采用多种复杂的微调策略,包括不同的微调方法、优化器、学习率和批大小。受模型无关元学习(MAML)启发,Sophon 设计了精细的微调模拟和微调评估算法,并精心优化训练过程,使模型陷入受限域内难以逃逸的局部最优。实验覆盖了分类和生成两种深度学习模式、七个受限域和六种模型架构,结果表明:对 Sophon 保护后的模型进行微调,所需开销接近甚至超过从零开始训练,从而有效遏制滥用。此外,Sophon 对三种微调方法、五种优化器以及多种超参数配置均表现出鲁棒性。该研究为安全、负责任的人工智能提供了新思路,适合对 AI 模型保护、模型鲁棒性、伦理安全感兴趣的蓝队人员、AI 安全工程师和研究者阅读。

💡 推荐理由: 预训练模型滥用已成为现实威胁,Sophon 提出从模型自身抑制微调迁移,为模型发布方提供一种主动防护手段,值得安全从业者关注其防御思路与适用边界。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Menghui Zhang, Aoying Zheng, Guoxiao Liu, Zizhuang Deng, Jiejing Wen, Jincheng Zhuang, Ran Tao

本文针对TEE卸载的LLM推理中一种防御方案ArrowCloak发起安全分析。TEE卸载将大模型线性层以混淆形式交给不可信加速器,在可信环境内仅保留小规模修正,以在保护模型权重的同时加速推理。先前攻击ArrowMatch利用权重向量方向不变性破坏了早期方案,ArrowCloak通过在所有权重向量中注入同一隐藏方向的标量倍数实现轻量级可信修正,以抵抗方向匹配。然而本文指出,这类重用使得加速器可见的完整矩阵存在秩一关系:所有行向量共享一个公共方向,仅标量不同。针对实值方案,作者提出SpectralLeak,先估计并移除共享分量,再训练替代模型;在12种任务设置下,替代模型平均准确率达87.98%,而受害模型为89.85%,说明攻击几乎无损。针对ArrowCloak的模Q安全版本,mod-Q运算虽抑制了谱信号,但秩一关系在模Q下仍保持为代数关系,构成一个隐藏格。作者提出LatticeLeak,利用该格结构在BERT-Base和GPT2-Base上精确重建每个受保护的定点参数;在所有评估架构上,重建模型无需任何受害者查询、标签或微调即可获得与受害者相当的任务准确率。实验证实共享秩一重用是泄露的根因。基于此,作者设计ButterflyCloak,一种带密钥的最大秩蝴蝶掩码,用不同掩码行替代重用方向,同时保留TEE内快速修正的能力。该论文彻底揭示了轻量级权重混淆的数学缺陷,并为TEE-LLM安全推理提供了新的防护设计思路。

💡 推荐理由: 该研究证明TEE卸载LLM时常用的轻量级权重混淆并不安全,可被数学方法完全攻破,导致模型权重精确泄露。对于依赖此类混淆保护模型知识产权的安全方案,是重要的安全隐患警示。

🎯 建议动作: 建议安全团队评估现有TEE-LLM卸载方案是否使用该类权重混淆,并考虑引入最大秩掩码或更安全的可信计算设计。建议研究跟进,验证自身资产受影响程度。

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Kurt M Wilson, Mohaiminul Al Nahian, Abeer Matar A. Almalky, Sadat Shahriyar, Souvik Kundu, Zhishan Guo, Abdullah Al Arafat, Adnan Siraj Rakin

本文提出 TEE-X,一个面向可信执行环境(TEE)的加速框架,旨在解决大型视觉模型(如 Vision Transformer, ViT)在边缘设备上部署时面临的内存限制和计算延迟问题。研究背景是:机器学习模型,尤其是视觉应用,容易受到多种安全威胁;白盒与黑盒威胁模型的差异影响攻击有效性。使用 TEE 可以通过保护模型机密性和执行完整性,将执行环境从白盒侧转移到黑盒侧,从而增强安全性。然而,将大型视觉模型完全放入 TEE 会带来显著的内存和延迟开销,尤其在安全性和隐私至关重要的实时边缘应用中。TEE-X 的核心方法包括:1) 灵敏度感知的模块化技术,将模型分解为不同敏感度级别的模块,以实现更精细的 TEE 内执行;2) 在 TEE 推理中引入向量化,提高计算效率。该框架在 OP-TEE(Arm TrustZone)上实现,并在 NVIDIA Jetson AGX Xavier 上针对 ViT 模型进行了性能优化。实验结果表明,TEE-X 能够在保证模型准确性和低延迟的前提下,实现安全快速的边缘推理,有效平衡了精度与性能。该工作为在资源受限的边缘设备上安全部署大型视觉模型提供了一种可行的加速方案。适合对 TEE、边缘 AI 安全、模型机密性和性能优化感兴趣的研究人员和工程师阅读。

💡 推荐理由: 为边缘端大视觉模型提供TEE内高效推理方案,在保障模型机密性与执行完整性的同时缓解延迟瓶颈,对自动驾驶、医疗影像等实时安全敏感场景有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yudong Gao, Linghan Chen, Wenhan Wu, Mia Zhou, Jiyao Wang, Kaiyan Ji, Mingyu Guo, Honglong Chen

该论文首次系统研究了量化视觉-语言-动作(VLA)模型在权重位翻转攻击下的安全脆弱性。研究背景在于,VLA模型通常以INT8量化部署于边缘设备,而Rowhammer等硬件故障可导致模型权重中的比特位被翻转,从而破坏模型的决策行为。论文提出了一种基于梯度选择的高效位翻转攻击方法:仅需少量精心挑选的比特翻转即可使闭环任务成功率降至0%,而随机翻转数百个比特则几乎无影响。这一攻击不需要任何输入样本,仅针对模型权重。为了评估不同动作解码架构的影响,作者在四种模型变体、三种动作头家族上进行了实验。结果表明,关键比特集中在少数动作生成层中,但攻击所需的翻转预算严重依赖于动作头的类型:直接回归和token策略仅需1-5次翻转即可成功,而流匹配策略则需要约100-300次。作者进一步提出了一种固定方向的流形逃逸损失函数,将视觉-语言-动作模型(π₀)的攻击预算从约1000次降至约100次翻转,并通过五方向扫描证明攻击并非仅针对单一正方向。针对直接回归头,保护3.1%的权重可在K=100次翻转下保持60%的成功率,而保护5.3%的权重可将开环失效阈值从3次提升到100次。最后,在真实机器人上通过任务校准的模拟K=100次翻转实现了0/20成功,而干净模型为14/20,全局随机翻转则保持16/20。研究结论认为,权重完整性是具身基础模型的安全边界。该工作为VLA模型的安全部署提供了量化洞察,并为后续防御研究奠定了基础。

💡 推荐理由: 首次证明VLA模型可用极少比特翻转被完全瓦解,且不同动作头架构导致攻击难度差异巨大。对依赖端侧量化的具身智能系统(如机器人、自动驾驶)而言,权重完整性必须被纳入信任边界。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Chong Fu 0002, Xuhong Zhang 0002, Shouling Ji, Ting Wang 0006, Peng Lin, Yanghe Feng, Jianwei Yin

本文针对深度神经网络中的木马(后门)攻击检测问题提出了一种新的无数据方法 FreeEagle。后门攻击是一种典型的人工智能威胁,被植入木马的模型在遇到带触发器的输入时会产生攻击者指定的异常行为,而在干净输入下表现正常。现有的后门检测方法大多依赖防御者能够获得一批干净验证样本或带有触发器的样本,但这一假设在真实世界中可能不成立,例如模型共享平台的维护者只能获得模型本身而无法获得训练数据或触发样本。为此,作者首次提出了无需依赖任何干净样本或带触发样本的 FreeEagle 方法,实现了对复杂后门攻击的有效检测。该方法通过分析模型内部表征和决策边界的异常特征,在数据不可见的情况下识别后门植入的痕迹。在多种数据集和模型架构上的评估结果表明,FreeEagle 对各类复杂后门攻击均有效,甚至在部分场景下优于现有的非无数据后门检测方法。该研究的核心贡献在于突破了传统检测方法对验证数据的依赖,为模型供应链安全提供了新的技术路径,尤其适用于模型共享、第三方模型审核等场景。本文适合研究深度学习安全、模型后门检测以及AI供应链安全的从业者和学者阅读。

💡 推荐理由: 模型共享平台和第三方模型审核往往无法获得训练数据或触发样本,FreeEagle 提供了无需任何样本的后门检测能力,极大提升了实际防御场景的可行性,对AI供应链安全具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Boyang Zhang, Zheng Li 0023, Ziqing Yang 0002, Xinlei He 0001, Michael Backes 0001, Mario Fritz, Yang Zhang 0016

该论文提出了一个名为 SecurityNet 的框架,旨在系统性地评估公开机器学习模型的安全性弱点。随着预训练模型在开源社区(如 Hugging Face)广泛发布,攻击者可能利用这些模型中的后门、对抗性扰动等漏洞。SecurityNet 通过组合多种攻击方法(包括对抗性攻击、后门注入、模型窃取等),对公开模型进行自动化安全评估。实验覆盖了图像分类、自然语言处理等多种任务中的主流模型架构(如 ResNet、BERT)。主要贡献包括:1) 设计了一个模块化的评估管线,支持多种攻击场景;2) 在大量公开模型上进行了实证研究,揭示了相当比例的模型存在可利用的漏洞;3) 提供了可复现的基准,帮助研究者比较不同防御手段的效果。该工作为模型发布前的安全审查和模型供应链风险管控提供了参考工具。

💡 推荐理由: 帮助安全团队在引入第三方预训练模型前评估潜在风险,降低模型供应链攻击的可能性。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Weijie Chen, Alan B. McMillan

联邦学习(FL)允许多方协作训练模型而不共享原始数据,但标准方法(如FedAvg)将每个客户端视为黑盒,无法隔离对抗性贡献者、审计每个客户端的影响,或尊重已退出参与者的被遗忘权。本文提出Fed-FBD(联邦功能块多样化),一种模块化联邦架构,将ResNet骨干网络分解为六个功能块(stem、四个残差组和分类头),并维护一个包含N种颜色变体的仓库,每种变体由独立跟踪和贡献者标记的块组装而成。Fed-FBD提供FedAvg所不具备的三种能力:(i) 架构保障的块级隔离,使对抗性或错误标记的客户端无法污染干净的变体;(ii) 设计上的隐私保护,在应用任何隐私机制之前,成员推断优势已与随机猜测无异;(iii) 在亚秒级成本且无需重新训练的情况下,外科手术式地遗忘已退出参与者的贡献。在六个MedMNIST-2D数据集、224x224的PathMNIST和CIFAR-10上的实验表明,在规模足够的数据集上,Fed-FBD以0.3%-3.1%的IID准确率下降换取这些保证,在四个数据集中的三个上,在Dirichlet alpha=1.0时与FedAvg的差距保持在0.8%-4.0%以内,并且所有六种对抗性攻击都被限制在中毒客户端的自身块内,对干净变体的AUC漂移不超过±0.01。

💡 推荐理由: 联邦学习中隐私、隔离与遗忘是安全关键需求。Fed-FBD首次在架构层面同时实现块级隔离、固有隐私和高效机器遗忘,为医疗等敏感场景提供可落地的安全设计思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)