推荐 5.5
Conf: 50%
本文针对隐私保护大语言模型(LLM)推理中的嵌入到嵌入混淆(Embedding-to-Embedding Obfuscation, E2EO)机制提出了一种新的攻击方法——代理流形对齐(Proxy Manifold Alignment, PMA)。E2EO方案允许用户将明文嵌入向量本地转换为固定长度的密文向量,以在保护查询隐私的同时保持模型可用性。已有研究表明,这类轻量级混淆方法能抵御传统的词频攻击和嵌入反演攻击,但其核心机制本质上仍是大规模的一对一替代,缺乏密码学意义上的安全保证。PMA攻击的核心观察是:E2EO方案保留了原始语义结构,因此混淆后的向量流可以视为一种“未知分词器语言”,其中每个符号就是向量本身。基于此,作者将密文到明文的恢复问题形式化为一个从该未知语言到自然语言的翻译任务。具体而言,攻击仅需访问混淆后的向量流、目标分词器以及公开语料库,即可实施:首先利用Word2Vec分别对混淆向量流和公开语料中的共现模式进行建模,构建两个代理向量嵌入;随后,基于结构相似性对齐这两个嵌入的底层流形;最后将混淆向量映射回明文。实验结果表明,PMA在明文恢复率上持续优于现有的最先进攻击方法。该论文揭示了E2EO方案在语义结构保持方面的内在弱点,提醒设计者仅依赖启发式混淆不足以提供强隐私保证,需考虑更稳健的防护机制。适合对LLM隐私保护、嵌入空间攻击与防御感兴趣的研究者阅读。
💡 推荐理由: 揭示了当前轻量级LLM隐私保护方案(E2EO)的实质性安全缺陷,说明仅依赖嵌入混淆难以抵抗结构对齐攻击,为蓝队评估此类防护的实际有效性提供重要参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)