该论文提出了一种名为 SHARD 的防御方法,旨在保护密集向量检索(如语义搜索和 RAG)中的嵌入向量不被反演攻击。现有攻击利用密集嵌入的全局几何结构,通过少量已知对齐对即可恢复秘密全局旋转(正交 Procrustes 方法)。SHARD 的核心思想是将中心化后的嵌入拆分为两部分:一个短的公共前缀(用于第一级检索)和一个私有的残差向量。残差向量被分片到 C 个单元中,每个单元使用独立的秘密密钥,并在 CKKS 同态加密下进行重排,密钥在计算中抵消,从而保留精确内积。参数 C 可调,从全局线性基线(C=1)到每个文档独享微密钥(C=N)。由于重排是全维度的,SHARD 可以恢复半 SVD 截断所牺牲的 nDCG@10 精度。同时,残差的密钥化单元使得在已知明文字典泄漏下,将残差映射回公共坐标系所需的锚点数量大约增加 C 倍(中位数从 200 到 102,400,当 C=256 时),且仅需少量加密查询。公共前缀泄露的邻域结构远少于全局嵌入,而微密钥机制使残差图在不可链接、可更新的模板下趋于零。该防御可抵抗学习型、非线性和无监督的对齐攻击。论文也坦承了局限性:单元内密钥相互抵消,目标攻击者只需约 d_priv 个锚点;若存在重叠的参考语料库,前缀仍可能泄露信息。SHARD 是一种攻击感知的几何防御,而非密码学保证。
💡 推荐理由: 该工作直接回应了 LLM 应用中向量数据库泄露导致的隐私风险,为安全从业者提供了一种可调节、可部署的嵌入保护方案,尤其适用于 RAG 场景。
🎯 建议动作: 研究跟进