该论文关注现代信息检索(IR)系统中嵌入模型的安全隐患。嵌入模型通常作为API端点隐藏在系统后端,但已有研究表明密集IR系统可能遭受嵌入反转攻击(即从检索结果反推输入文本或嵌入向量)。然而,此类攻击通常假设攻击者已知嵌入模型的具体细节(白盒场景)。本文首次提出一种在黑盒场景下的嵌入推理攻击(Embedding Inference Attack, EIA),该攻击仅观察到检索结果的文档集合(无序、无排名、无相似度分数),旨在识别系统背后使用的是哪一种嵌入模型。论文的核心方法是构造一组区分性查询:对于候选的已知嵌入模型集合,通过分析检索结果集合的差异,推断出实际使用的模型。实验表明,即使系统引入了重排序器(reranker)作为防御,部分查询仍能保持区分性。该攻击进一步在真实的检索增强生成(RAG)系统中得到验证——通过巧妙构造的查询,可以绕过大语言模型(LLM)对非标准输入形式的拒绝响应,成功实施模型推理。此外,论文探讨了防御策略,如设置相似度阈值来过滤部分检索结果,并评估了有效性。本研究的贡献在于:揭示了嵌入模型被黑盒推断的风险,提出了低成本的攻击方法,并验证了在RAG系统等实际场景中的可行性,为后续安全设计提供了参考。适合关注LLM/IR系统安全的研究人员、蓝队工程师以及RAG系统开发人员阅读。
💡 推荐理由: 该攻击暴露了嵌入模型在API场景下的指纹识别风险,可能成为其他高级攻击(如模型窃取、对抗样本)的前置步骤,对RAG系统和私有嵌入服务构成潜在威胁。
🎯 建议动作: 研究跟进,评估自身RAG系统或嵌入API对模型推理攻击的抵抗力