#trustworthy-ml

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Simin Chen, Jinjun Peng, Yixin He 0002, Junfeng Yang, Baishakhi Ray

本研究首次系统性地揭示了深度学习编译器中的编译不一致性漏洞(Compilation Inconsistency Vulnerability)。作者发现,即使是官方、未经修改的深度学习编译器,也可能在模型编译过程中静默改变模型语义,从而引入隐藏后门。研究从两个角度展开:对抗性设定和自然设定。在对抗性设定中,作者精心构造了良性模型,其中的触发器在编译前不产生任何效果,但经过编译器编译后,触发器变为有效的后门。在6个模型(包括ResNet、BERT等)、3个商用编译器(如TensorFlow XLA、PyTorch JIT、TVM)以及2种硬件平台(CPU和GPU)上的实验表明,该攻击对触发输入的成功率为100%,同时保持正常准确率,并能绕过最先进的防御检测器。攻击泛化到不同编译器、硬件和浮点设置。在自然设定中,作者分析了HuggingFace上排名前100的模型(包括一个下载量超2.2亿的模型),发现其中31个模型存在自然触发器,即在编译后模型对某些正常输入的行为发生改变。这表明即使没有对抗性操纵,编译器也可能引入风险。该工作首次暴露了深度学习编译器设计中被忽视的安全威胁,为构建安全可信的机器学习系统开辟了新方向。

💡 推荐理由: 深度学习编译器是AI基础设施的核心组件,本发现揭示其可能被利用来植入后门,影响所有使用编译器的模型部署。安全团队需关注编译环节的完整性,防止供应链攻击。

🎯 建议动作: 研究跟进:阅读论文获取详细攻击方法与检测方案,评估内部使用的编译器是否受影响。

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)