#inference

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Peihua Mai, Xuanrong Gao, Youlong Ding, Xianglong Du, Wei Liu, Yan Pang

随着ChatGPT等公共大语言模型(LLM)的广泛部署,用户提示(prompt)的隐私保护成为关键问题。现有的隐私保护推理方法要么牺牲效用,要么牺牲效率,并且通常需要针对特定模型进行修改,兼容性受限。本文提出SharedRequest,一种模型无关的隐私保护LLM推理框架,将隐私保护从单个提示层面提升到批次层面。核心思想是将原始提示与噪声变体混合以混淆敏感信息,同时将语义等价的指令分组,从而在大型查询批次中摊销推理成本,对LLM响应质量影响极小。该设计独立于LLM架构,无需访问模型参数或修改架构。实验结果表明,与之前的差分隐私基线相比,SharedRequest的效用提升超过20%;与非分批推理相比,其共享提示机制将查询成本降低最多5倍。本文适合关注LLM隐私保护、模型部署效率和安全研究的人员阅读。

💡 推荐理由: 提出了一种实用且兼容性强的隐私保护推理方法,无需修改模型即可保护用户提示隐私,同时保持效用和效率,对公共LLM服务中的隐私合规有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Guanlong Wu, Zhaohan li, Yao Zhang, Zheng Zhang, Jianyu Niu, Ye Wu, Yinqian Zhang

大型语言模型(LLM)依赖键值(KV)缓存加速推理,许多服务系统进一步在用户请求间共享KV缓存以减少冗余计算。然而,无限制的跨用户共享引入了侧信道漏洞,攻击者可以通过探测缓存是否命中来推断用户输入。现有防御完全禁用共享以避免泄漏,但这种粗粒度的策略牺牲了巨大的复用潜力,因为提示中通常包含大量隐私无关的片段,如系统指令或公开可访问的材料。基于此,本文提出CachePrune,一种隐私感知的KV缓存共享机制,实现在请求之间对KV条目进行细粒度复用。实现这种细粒度需要令牌级别的缓存管理,因为可复用片段因敏感性掩蔽而在长度和位置上变化,使得复用比现有粗粒度方案中使用的固定大小或句子级分块更复杂。具体而言,CachePrune通过解决两个关键挑战使细粒度复用变得可行:准确高效地推导可复用KV片段,以及在可变长度跨度上高效检索它们。作者在vLLM上实现了CachePrune,并在三个数据集上进行了评估,结果表明它消除了通过KV缓存重用侧信道的直接泄漏,同时与最先进的方法相比,将TTFT(首个令牌时间)降低了4.5倍,缓存命中率提高了44%。本文的主要贡献包括:提出隐私感知的细粒度KV缓存共享框架,设计令牌级别的缓存管理和检索算法,并通过实验证明了其在隐私保护和性能提升上的有效性。适合对LLM推理系统安全、隐私保护和性能优化感兴趣的研究人员阅读。

💡 推荐理由: LLM推理系统中跨用户KV缓存共享在提升效率的同时引入了隐私侧信道泄漏风险。CachePrune首次实现了细粒度隐私感知的缓存复用,在不牺牲性能的前提下消除泄漏,对大规模LLM服务的隐私保护有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mu Yuan, Lan Zhang 0002, Yihang Cheng 0002, Miao-Hui Song, Guoliang Xing, Xiang-Yang Li 0001

本文提出了STIP(Secure Three-party Inference Protocol),一种用于大型Transformer模型在生产环境中的三方隐私保护无损推理方案。研究背景是,随着大型Transformer模型(如BERT、GPT系列)在云服务中的广泛部署,用户输入的隐私保护成为关键挑战。现有的隐私保护推理方法(如安全多方计算、同态加密)往往面临巨大的计算开销或精度损失,且难以直接适配Transformer的复杂结构(如非线性激活函数、自注意力机制)。STIP的核心创新包括:(1)设计了一种高效的秘密共享协议,支持在三个非共谋服务器之间进行线性层和非线性层的无损计算,特别针对Transformer中的GeLU、Softmax等函数进行了优化,通过函数拟合与定点数算术结合,实现了完全无损(即计算结果与明文推理完全一致)。(2)提出了自适应分割策略,将模型按层动态分配给三台服务器,以平衡计算负载和通信开销。(3)在安全性方面,STIP确保了半诚实模型下的隐私保护,任何两台服务器合谋也无法获取用户的输入或模型参数。实验基于多种主流Transformer架构(如BERT-Base、BERT-Large、GPT-2)在标准数据集上进行了评估。结果表明,与现有最佳方案相比,STIP将推理延迟降低了约40%,通信量减少了约30%,同时保持了无损精度。该方案适合对隐私和精度均有严格要求的生产环境,如医疗诊断、金融风控等场景。本文的主要贡献在于首次实现了面向大型Transformer的全流程三方无损隐私推理,并通过系统优化将开销降至实际可行的水平。

💡 推荐理由: 在云服务中使用大型Transformer模型时,用户数据隐私至关重要。STIP提供了首个兼顾隐私、精度和效率的三方推理方案,其无损特性可避免因隐私保护带来的精度下降,对生产部署具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)