本论文研究图基础模型(GFM)的对抗攻击问题。GFM通过一个共享表示层(对齐层)将不同图域的输入映射到统一表示,然后进行下游推理。作者首次提出这一对齐层是GFM独有的攻击面,而传统图神经网络(GNN)没有。他们设计了两类攻击:表示空间扰动攻击和可实现输入空间攻击。前者在推理阶段直接扰动共享表示,实验显示,对于六个公开GFM(包括谱分词器、文本嵌入空间和离散码本模型),扰动都能使模型崩溃,但所需预算与普通GNN相当;例外是OpenGraph,其谱分词器在仅需普通GNN五分之一预算下就崩溃,表明该脆弱性源于对齐层而非解码器。后者通过编辑输入图中的边、特征或文本实现攻击,在六个模型中的三个上,峰值时可移除超过一半的正确预测。进一步分析表明,攻击效果的强弱取决于解码器读取表示的直接程度,而非模型本身的干净准确率。作者从解码器的局部Lipschitz敏感性出发,提出了衡量攻击脆弱性的载波增益指标,并指出干净准确率余量作为排序启发式在可实现攻击下不成立。该工作首次系统揭示并量化了GFM共享表示的脆弱性,为后续防御研究提供了基础。
💡 推荐理由: 图基础模型在欺诈检测、药物发现等安全关键领域广泛应用,其共享表示层是新攻击面,可能导致模型在推理时被轻易欺骗,影响下游任务可靠性。
🎯 建议动作: 研究跟进