#nearest-neighbor

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Isamu Isozaki, Madison Bratina, Edward Kim

本文提出了一种在单个GPU上对十亿级向量数据库执行全同态加密(FHE)最近邻搜索的系统,核心目标是让服务器在无法看到明文查询的情况下完成相似度评分,并返回仅客户端可解的加密结果。为了解决全库加密评分在十亿规模下速度过慢的问题,作者结合了两种技术:一是秩缩减,即通过降维减小每个向量的维度;二是层次化路由,即先粗粒度筛选出少量候选集,再在候选集内精细匹配,整个流程均在加密状态下进行。实验在三个不同规模的语料库上展开:包含约22万个人脸质心(512维)的语料库、包含13.9亿个512维CLIP向量的DataComp-1B,以及包含10亿个96维向量的Deep1B。在DataComp-1B上,系统在GPU上实现了单次加密查询约6秒的延迟,recall@10达到0.90(若近重复图片也计为正确则可达0.95);轻量配置下延迟约1.8秒,recall@10为0.78/0.83。在Deep1B上,全级别FHE下recall@10为0.90(在2000次查询中测得0.9045,与明文路由的0.906基本一致),每次查询热延迟2.3秒。以上延迟均为服务器端可部署的“热”延迟,不包含客户端解密和网络传输。作者详细描述了可复现的客户端-服务器协议,并报告了各配置下的精度与延迟。此外,论文量化了该加速方案带来的隐私代价:层次化路由的访问模式会泄露数据库的几何结构,仅凭访问模式即可恢复72%的粗粒度单元邻居图;为此作者提出种子(固定组)填充方法,可将泄漏降至约2%,而朴素填充会被重复查询攻击轻易攻破。

💡 推荐理由: 该研究首次展示了在十亿规模向量库上实现实用级FHE最近邻搜索的可能性,为隐私保护检索提供了可部署方案。同时,它揭示了加密系统中访问模式泄漏这一隐蔽风险,并给出缓解方法,对安全从业者设计低泄漏密文检索系统具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)