#search

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Peichun Hua, Danyang Chen, Junan Zhang, Haifeng Sun, Jingyu Wang, Diwen Xue, Mingyu Li, Yunming Xiao

本文提出了一种实用的私有密集检索方案,用于托管式检索增强生成(RAG)和语义搜索场景。研究背景是:用户希望查询提供方持有的有价值的语料库,但存在两个相互矛盾的需求:一方面需要隐藏用户的查询和最终选择的结果,另一方面又只能向用户展示其被授权访问的文档。现有的密码学方法要么需要对整个语料库进行全量加密处理,导致每次查询成本高昂;要么通过扫描少量聚类牺牲检索质量来换取效率。本文的核心创新是将学习式深度哈希用作隐私过滤器:通过一个随机化的二进制代码将提供方指向一个较短的候选列表,然后使用加密重排序和遗忘密钥传输来保护精确查询和最终选择。这种方法避免了全语料库密码学搜索的开销,同时不牺牲检索质量:仅需200-500个候选文档,就能在五个零样本语料库(规模从2.5万到540万篇文档)上紧密匹配全语料库检索的性能。在包含268万段落的NQ语料库上,通过10Gbps链路,该协议仅为128-token的Qwen3-32B RAG流水线增加了0.73秒的额外开销,即约10%的延迟增幅。作者发布的相关代码满足方向性度量差分隐私(DP),并显著降低了嵌入反演和属性推断泄露。实验证明,经过精心学习的候选列表可以使私有密集检索既准确又实用。该研究适合关注隐私保护、检索增强生成、信息检索和安全领域的学者与工程师阅读。

💡 推荐理由: 该方案直接解决了托管RAG和语义搜索中查询隐私与授权访问的矛盾,能在不牺牲检索质量的前提下大幅降低隐私开销,为实际部署隐私保护检索提供了可行路径。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)