#trustworthy-ml

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Gregory Blanc, Takeshi Takahashi 0001, Zonghua Zhang

本论文为 ARTMAN '25 研讨会(第三届弹性与可信机器学习驱动系统前沿进展研讨会)的征稿与主题介绍。该研讨会聚焦于机器学习驱动的系统在面对故障、攻击和异常时的韧性与可信性,旨在汇聚安全、可靠性与机器学习交叉领域的研究者。文中概述了研讨会的核心关注点,包括:如何在不可信或对抗性环境中确保 ML 系统的持续运行、如何评估和提升模型对恶意输入的鲁棒性、以及如何将形式化保证与运行时监控结合以增强系统可信度。同时,研讨会鼓励探讨真实场景下 ML 系统的部署挑战,如分布式系统、边缘计算和关键基础设施中的可靠性。尽管 abstract 未展示具体技术细节或实验方法,但明确了研讨会的目标是为研究者提供一个交流最新攻击与防御思路、分享实证经验的平台。本文适合对机器学习系统安全性、可恢复性设计感兴趣的学者和安全工程师阅读,作为了解该领域前沿研究方向与开放问题的入口。由于仅有研讨会简介,缺乏具体方法论和结果,本摘要仅基于 abstract 内容。

💡 推荐理由: 机器学习系统正被广泛部署于关键业务,但其面对对抗性干扰和故障时的韧性仍是重大盲区。本研讨会主题直接指向蓝队急需的可信ML落地思路,值得关注。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.3)
👥 作者: Simin Chen, Jinjun Peng, Yixin He 0002, Junfeng Yang, Baishakhi Ray

本研究首次系统性地揭示了深度学习编译器中的编译不一致性漏洞(Compilation Inconsistency Vulnerability)。作者发现,即使是官方、未经修改的深度学习编译器,也可能在模型编译过程中静默改变模型语义,从而引入隐藏后门。研究从两个角度展开:对抗性设定和自然设定。在对抗性设定中,作者精心构造了良性模型,其中的触发器在编译前不产生任何效果,但经过编译器编译后,触发器变为有效的后门。在6个模型(包括ResNet、BERT等)、3个商用编译器(如TensorFlow XLA、PyTorch JIT、TVM)以及2种硬件平台(CPU和GPU)上的实验表明,该攻击对触发输入的成功率为100%,同时保持正常准确率,并能绕过最先进的防御检测器。攻击泛化到不同编译器、硬件和浮点设置。在自然设定中,作者分析了HuggingFace上排名前100的模型(包括一个下载量超2.2亿的模型),发现其中31个模型存在自然触发器,即在编译后模型对某些正常输入的行为发生改变。这表明即使没有对抗性操纵,编译器也可能引入风险。该工作首次暴露了深度学习编译器设计中被忽视的安全威胁,为构建安全可信的机器学习系统开辟了新方向。

💡 推荐理由: 深度学习编译器是AI基础设施的核心组件,本发现揭示其可能被利用来植入后门,影响所有使用编译器的模型部署。安全团队需关注编译环节的完整性,防止供应链攻击。

🎯 建议动作: 研究跟进:阅读论文获取详细攻击方法与检测方案,评估内部使用的编译器是否受影响。

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)