#ml-security

共收录 11 条相关安全情报。

← 返回所有主题
推荐 3.6
Conf: 50%
👥 作者: Habibur Rahaman, Qipan Xu, Zafaryab Haider, Prabuddha Chakraborty, Swarup Bhunia, Fnu Suya

本文提出了一种针对机器学习基础设施的新型攻击面——寄生基础设施木马(Parasitic Infrastructure Trojan),并展示了具体实现(A)iSpy。现代机器学习流水线高度依赖第三方库进行图编译和硬件加速,现有安全实践主要审计数据、模型工件或依赖文件完整性检查,但执行环境通常被隐式信任。这留给攻击者一个盲点:恶意运行时模块可以直接与实时的训练和推理动态交互。通过这种交互,木马能够实现复杂的攻击目标,远超传统静态代码或二进制修改的能力,甚至可以完成标准数据和模型层面攻击无法实现的操纵。 (A)iSpy采用“主动观察与执行”范式,作为寄生模块运行在计算图中,监视瞬态张量状态,以极低的副效应进行目标性、隐秘的操纵。在机密性方面,木马能够识别所有关键训练超参数,并通过模型权重或输出logits隐蔽地外泄这些参数。在完整性方面,它作为梯度放大器:通过观察隐写触因,将原本弱的数据中毒转化为有效的后门攻击,成功率从接近0%提升至100%。论文还通过附录验证了该攻击在机器学习生命周期中的广泛扩展性,包括子种群标签翻转、可用性中断和推理阶段操纵。 (A)iSpy模块能够轻易逃避标准恶意软件扫描器,其关联的中毒输入和受感染的模型也能绕过典型的检查工具。作者在ONNX Runtime训练和推理引擎中实现了该攻击,证明其实际可行性。这项工作揭示了ML基础设施中新的信任链脆弱性,对依赖第三方库的ML系统构成严重威胁,为安全社区提供了防御研究的新方向。

💡 推荐理由: 揭露了ML基础设施中执行环境的盲点信任问题,提出一种新型、高效且隐秘的寄生木马,能同时破坏机密性和完整性,对生产环境中的ML管道构成实际威胁。

🎯 建议动作: 安全团队应评估自身ML管道对第三方运行时库的依赖情况,研究如何加强执行环境的安全审计与运行时监控。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 3.5
Conf: 50%
👥 作者: Michael Ngo, Michael P. Kim

该论文旨在解决机器学习模型输出结果的可公开验证性问题。作者在Goldwasser等人提出的交互式学习证明框架基础上,首次研究了非交互式学习证明,并定义了一种新概念:公开可验证的统计有效性证书(Publicly-Verifiable Certificates of Statistical Validity, pvCSVs)。该证书允许学习算法发布一个假设h及其对应的证书π,任何持有特定分布的用户都能有效验证该假设在该分布下是否有效。论文重点在自适应统计查询(Adaptive Statistical Query, SQ)算法场景下构造pvCSVs。对于进行了k次自适应查询的SQ算法,作者构建的pvCSVs的样本复杂度仅为O(log k),而最优学习算法的样本复杂度为~O(√k),展现了显著优势。此外,论文更广泛地研究了SQ模型中的学习证明系统,展示了该模型的优势与局限性。该工作为机器学习模型的可验证性、鲁棒性和公平性认证提供了新思路,尤其适用于需要公开验证模型性能的场景,如联邦学习、可信AI审计等。

💡 推荐理由: 该研究首次将交互式学习证明扩展到非交互式,显著降低了验证样本复杂度,是机器学习安全认证领域的重要理论突破。安全从业者可借鉴其思路,构建更高效的模型抗篡改证明或审计机制。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Gabriele Digregorio, Marco Di Gennaro, Francesco Pastore, Stefano Zanero, Stefano Longari, Michele Carminati

该论文聚焦于机器学习模型执行过程中的安全威胁。随着预训练模型的广泛复用,攻击者可以将恶意行为嵌入模型文件,而现有基于静态规则或已知签名的方法难以泛化到不同框架且无法检测未知漏洞。作者提出一种动态生命周期感知分析方法,核心观察是ML模型在明确定义的阶段(如加载、预处理、推理等)内执行,且每个阶段与宿主系统的交互高度结构化、可预测。基于此,设计了Moat框架及其实例化实现Re-Moat。Re-Moat在模型执行期间动态监控系统调用,检测异常行为。实验使用来自Hugging Face Hub的77,974个真实模型工件、31个CVE的概念验证代码以及334个来自最新数据集模型进行评估,并与当前最先进的模型扫描方案对比。结果显示,该方法能检测所有评估的攻击类别,同时保持接近零的误报率,验证了动态分析在保障ML模型执行安全中的有效性。

💡 推荐理由: 该研究为ML供应链安全提供了动态分析方法,弥补了静态扫描的不足,有望防御未知的模型后门和利用,对依赖第三方模型的组织具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 8.6
Conf: 50%
👥 作者: Vasisht Duddu, Lipeng He, Asim Waheed, N. Asokan

本文是一篇系统化知识(SoK)论文,聚焦于机器学习管道中对手合谋的问题。现有的对抗性攻击研究通常孤立地考虑单一对手,但实际场景中对手可能通过合谋来放大攻击效果。论文首先提出一个系统化框架,涵盖两类合谋场景:(a)训练时对手与推理时对手之间的合谋;(b)推理时多个对手之间的合谋。框架识别了促成合谋的关键因素,包括对手目标、知识、能力以及攻击的时序依赖性等。基于这些因素,作者提出一套指导原则,用于推测哪些合谋组合是可能发生的。利用该指导原则,论文重新解释了先前工作中存在的隐含合谋关系,并推测了五种尚未被探索的合谋案例。随后,作者通过实验验证了这五种合谋确实存在且能显著增强攻击效果。最后,论文讨论了合谋对手的不同特征(如目标冲突、能力差异)如何影响合谋的潜力与可行性。该工作为ML安全社区提供了统一的分析视角,有助于设计更鲁棒的防御策略。适合安全研究人员、ML工程师以及对抗性机器学习领域的学生阅读。

💡 推荐理由: 首次系统化分析机器学习管道中对手合谋问题,揭示合谋可能放大攻击效果,为安全评估和防御设计提供新视角。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

本文系统性地研究了多模态大语言模型(MLLMs)中的隐私风险。与文本大语言模型(LLMs)不同,MLLMs同时处理文本和图像,图像中嵌入的敏感信息可能被模型提取并泄露。作者首先构建了MM-Privacy综合数据集,覆盖多种多模态任务和场景,定义了表露风险(Disclosure Risks)和留存风险(Retention Risks)。然后,他们使用MM-Privacy对多个MLLM进行了系统评估,发现模型在不同任务中均存在泄露敏感信息的问题。此外,论文还揭示了任务不一致性(task inconsistency)在隐私风险中的角色,并强调了制定缓解策略的紧迫性。实验结果表明,MLLMs的隐私风险不容忽视,亟需防护措施以防止数据暴露。该研究为多模态AI的隐私保护提供了基准和方向,适合安全研究人员和AI开发者阅读。

💡 推荐理由: 多模态大模型处理图像数据时可能泄露嵌入的敏感信息,现有文本LLM隐私防护不足以应对,本研究首次系统性揭露该风险,对蓝队评估MLLM安全至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.6
Conf: 50%
👥 作者: Hengrui Jia 0001, Mohammad Yaghini, Christopher A. Choquette-Choo, Natalie Dullerud, Anvith Thudi, Varun Chandrasekaran, Nicolas Papernot

该论文提出了机器学习中的“学习证明”(Proof-of-Learning)概念,旨在解决模型训练完成后,训练者无法向第三方证明模型参数确实是通过给定优化过程得到的问题。现有方法无法验证训练计算的真实性,这可能导致模型所有权争议或分布式训练中拜占庭工返回错误更新。受工作量证明和可验证计算启发,作者观察到随机梯度下降(SGD)算法因其随机性会累积秘密信息(即模型更新路径上的随机梯度和参数历史),从而自然构成一种学习证明。具体而言,训练者通过发布模型参数以及一组包含中间参数和随机梯度的证明,验证者可以高效检查证明的正确性。作者通过分析和实验证明,攻击者若想伪造学习证明,所需计算量至少与执行完整梯度下降相当。论文在两个场景中实例化了该机制:模型所有权争议中,用于保护公开发布模型的知识产权;分布式训练中,用于确保训练过程的可用性,防止拜占庭工拒绝服务。实验表明,该机制对硬件(如ML加速器)和软件栈引起的方差具有鲁棒性。

💡 推荐理由: 该研究首次为机器学习模型训练提供了可验证性机制,有助于解决模型所有权纠纷并增强分布式训练的安全性,对保护AI知识产权和提升训练基础设施可信度有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Mohamed elShehaby, Ashraf Matrawy

本文研究基于梯度的对抗性攻击对机器学习驱动的网络入侵检测系统(ML-NIDS)的威胁,并提出一种无需显式防御的“无防御”方法:通过精心选择模型架构即可实现固有鲁棒性。作者进行了约2200次实验,在FGSM、PGD和BIM攻击下,系统性地变化网络深度、特征维度、激活函数和dropout。结果表明,较浅的网络、精简的特征集以及ReLU激活函数能够一致且协同地降低对抗脆弱性。一个遵循此原则的简单模型甚至优于更深的、经过对抗训练的完全特征模型,同时保持近乎完美的干净流量检测性能,且训练时间更短。论文强调“少即是多”,但关键在于选择正确的“少”。该研究为构建轻量级、鲁棒的ML-NIDS提供了设计指南。

💡 推荐理由: 该研究挑战了对抗训练等复杂防御方法的必要性,提出通过架构选择即可提升ML-NIDS的鲁棒性,可降低部署和维护成本。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jung-Woo Chang, Ke Sun 0012, Nasimeh Heydaribeni, Seira Hidano, Xinyu Zhang 0003, Farinaz Koushanfar

本文提出了一种名为Magmaw的新型无线攻击方法,旨在针对基于机器学习(ML)的无线通信系统生成通用对抗扰动。现有针对ML无线系统的对抗攻击方法缺乏对源数据多模态性、常见物理层协议和无线域约束的全面考虑。Magmaw能够为通过无线信道传输的任何多模态信号生成通用对抗扰动,并引入了针对下游应用的对抗攻击新目标。为验证其鲁棒性,作者采用了广泛使用的防御机制,并通过软件定义无线电系统构建了实时无线攻击平台进行概念验证评估。实验结果表明,即使在强防御机制下,Magmaw仍能造成显著的性能下降。此外,在加密通信信道和基于信道模态的ML模型两个案例研究中进一步验证了其有效性。该研究揭示了ML无线通信系统在面对多模态通用对抗攻击时的脆弱性,对无线安全领域具有重要警示意义。

💡 推荐理由: 该研究首次系统性地提出了针对多模态无线通信系统的通用对抗攻击方法,揭示了现有ML无线系统在安全设计上的不足,对保障未来无线通信(如5G/6G)的安全性具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Brody Kutt, William Hewlett, Oleksii Starov, Yuchen Zhou

本文提出了一种名为“Innocent Until Proven Guilty (IUPG)”的新型深度学习训练框架,旨在解决传统分类器(使用分类交叉熵损失)在真实世界环境中面临的三个关键问题:对分布外输入给出过度自信的后验概率、对对抗性噪声的敏感性以及因分布偏移导致的性能下降。作者认为这些问题的核心缺陷是模型无法有效处理输入中的分布外内容。IUPG框架通过在输入空间中原型化训练数据簇或类别,并独特地利用噪声和固有随机类来发现所建模类别的噪声鲁棒、唯一可识别的特征。在评估中,作者使用了学术计算机视觉数据集以及用于恶意软件分类的真实世界JavaScript和URL数据集。实验结果表明,与相同拓扑结构、使用分类交叉熵训练的基线网络相比,IUPG框架在测试数据上取得了良好的分类性能,减少了因近期偏差导致的性能损失,降低了噪声样本上的误报率,并在多种基于噪声的攻击模拟中降低了脆弱性。据作者所知,这是首个展示在恶意软件黑盒附加攻击上显著降低脆弱性的工作。通过应用快速梯度符号法(FGSM),作者展示了将IUPG与现有对抗学习技术结合的潜力,并取得了显著更优的性能。该框架具有通用性,可用于任何原本可以使用分类交叉熵训练的网络拓扑。

💡 推荐理由: 该工作针对恶意软件检测中常见的分布外样本和对抗攻击问题,提出了一种增强鲁棒性的训练框架,有助于提升安全模型的防御能力。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 6.5
Conf: 50%
👥 作者: Nnamdi Jibunoh, Sara Khanchi, Adetokunbo Makanju

该论文对零日攻击的本质进行了系统性的再审视,核心研究问题是:零日攻击究竟源于新颖的攻击行为还是新颖的漏洞?作者回顾了跨越20年的已记录零日攻击事件,发现这些攻击无一例外地源自对未公开漏洞(即零日漏洞)的利用,而非攻击者采用了前所未见的行为模式(TTPs)。基于这一发现,论文提出了一种基于漏洞类型的分类法,将零日漏洞分为内存破坏、逻辑错误、配置缺陷等类别,并统计了各类型在历史事件中的出现频率,结果显示内存破坏漏洞最为常见,而针对防御机制漏洞的攻击在近年呈上升趋势。作者进一步分析了现有基于机器学习(ML)的入侵检测系统(IDS)所依赖的假设,指出一个关键错位:事件报告强调漏洞利用,而许多ML检测器却旨在检测假设中的“新颖行为”,例如异常流量模式或异常系统调用。这种错位可能导致ML-IDS的零日检测能力被高估。论文认为,以漏洞为中心的方法(如自动补丁生成、内存安全强化)更贴合真实攻击机制,并呼吁业界谨慎解读行为检测的声称,同时推动开发更符合现实利用特征的自动漏洞检测框架。研究结论对于设计下一代入侵检测系统具有指导意义,强调应优先发展漏洞侧的方法,而非单纯依赖行为分析。

💡 推荐理由: 该论文澄清了零日攻击的本质是漏洞利用而非行为异常,有助于从业者避免被ML-IDS的“零日检测”宣传误导,从而合理分配防御资源。

🎯 建议动作: 研究跟进

排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)