推荐 8.5
Conf: 50%
该论文首次系统性地研究了图基础模型(Graph Foundation Models, GFMs)中“对齐层”(alignment layer)这一独特攻击面。图基础模型通过将不同领域的图输入映射到一个共享表示空间,然后进行任务推理,这一映射层是对齐层,它将GFM与普通图神经网络区分开来。作者在推理时(无训练访问权限)攻击六个公开的GFM,包括基于谱分词器、文本嵌入空间和离散码本的模型。在表示空间中进行定向扰动,所有模型均会崩溃,但预算与普通图网络表示范数相当;例外是OpenGraph,其谱分词器在五分之一的预算下即崩溃,表明对齐层特有的脆弱性,而普通图网络不共享此脆弱性。通过控制表示层解码器部分的相同表示进行归因分析,确认脆弱性来自分词器而非解码器。此外,可实现的输入空间攻击(编辑边、特征或文本)在六个模型中的三个上使至少一半的正确预测失效。攻击者利用输入访问实现脆弱性的程度与解码器直接读取表示的程度正相关,而非与任务准确率正相关。作者通过解码器局部Lipschitz敏感性结构性地测量了这种“传播增益”,并指出干净准确率裕度作为模型内排序启发式在实际攻击中不成立。该研究揭示了GFM对齐层是一个重要的新攻击面,对AI安全社区具有参考价值。
💡 推荐理由: 图基础模型是AI前沿,本文首次揭示其对齐层是独特攻击面,与普通图神经网络不同,为防御者提供了新的安全考量。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)