#dense-retrieval

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Peichun Hua, Danyang Chen, Junan Zhang, Haifeng Sun, Jingyu Wang, Diwen Xue, Mingyu Li, Yunming Xiao

本文研究托管式检索增强生成(RAG)与语义搜索中的隐私保护问题。在实际场景中,用户向服务商持有的大型语料库发起查询,既需要隐藏查询内容与最终选中的文档,又需要确保用户仅能获取其被授权的文档。现有密码学方法要么为每条查询处理整个语料库而导致高昂开销,要么仅扫描少量聚类而牺牲检索质量。本文提出一种实用的私有稠密检索方案,核心思想是复用学习型深度哈希作为私有过滤器:通过随机化的二进制码将服务商引导至一个较短的候选列表,随后利用加密重排序和不经意密钥传输来保护精确查询与最终选择。该短列表机制绕过了全语料库密码学搜索的计算瓶颈,同时不损失检索质量。实验覆盖5个零样本语料库,规模从2.5万到540万文档不等,结果显示仅需200-500个候选文档即可接近全语料库检索的效果。在包含268万段落的NQ数据集上,通过10 Gbps链路,该协议仅给一个128 token的Qwen3-32B RAG流水线增加了0.73秒(约10%)的延迟。作者还公开了代码,并证明方案满足方向性度量差分隐私,显著减少了嵌入反演和属性推断泄露风险。研究表明,精心学习的短列表可以使私有稠密检索在准确性和实用性之间取得良好平衡。适合关注隐私增强技术、RAG安全、信息检索与机器学习交叉领域的研究人员、安全工程师及系统设计者阅读。

💡 推荐理由: 该研究将隐私保护引入主流RAG/语义搜索,解决了密码学方法效率低与聚类方法质量差的矛盾,为隐私增强的检索系统提供了可落地方案,对数据合规和敏感语料保护有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)