PIMENTO 是一个针对非结构化文本分析隐私保护的框架。当前两种主流隐私保证——上下文完整性(CI,约束信息可流向何处)与差分隐私(DP,约束可推断出什么)——都难以直接映射到自然语言上,导致现有方案无法为文本分析提供形式化保证。PIMENTO 将三种自然语言形式(文本语料、查询、隐私政策)统一映射到关系数据库中,构建公共基底,从而可同时形式化地执行 CI 与 DP。其三项核心贡献包括:1)DP 感知的 Text-to-SQL,在候选查询中寻找正确且所需 DP 噪声最小的查询;2)CI 感知的 Text-to-SQL,将自然语言隐私政策编译为数据库上可执行的 CI 规则;3)提出新的隐私定义“上下文差分隐私”,在 CI 下重新定义 DP 邻域,得到更紧的平滑敏感度上界。在新基准测试中,PIMENTO 在 75.3% 的情况下选出最佳查询(较基线最高提升 45 个百分点),并在正确政策落地时实现零泄漏。据作者所知,这是首个在 CI、DP 及其组合下为自然语言分析提供形式化隐私保证的框架。
💡 推荐理由: 对隐私工程、LLM 数据分析和合规团队有直接价值:它把 CI 与 DP 形式化地结合到 Text-to-SQL 流程中,提供了可落地的文本分析隐私保障思路,尤其适合需要处理敏感语料又需自然语言查询的场景。
🎯 建议动作: 研究跟进