#selective-certification

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Sanjeda Akter, Ibne Farabi Shihab, Anuj Sharma

本文提出 Fed-SRC,一种面向联邦检索增强生成(Retrieval-Augmented Generation, RAG)的私有任意时间选择性风险认证框架。选择性风险证书的核心承诺是:所有被模型接受的输出都能满足预设的错误率目标。与以往依赖特定分数分布的方案不同,Fed-SRC 是分数不可知的,并集成差分隐私与自适应监控。各客户端仅发布经过高斯扰动后的分数直方图与损失直方图,避免直接暴露原始数据。方法上,作者利用记录索引和噪声方差索引两类鞅(martingale)联合约束目标风险对比和接受质量,覆盖所有已注册的阈值与轮次,从而支持可预测的参与者招募、退群、阈值选择和可选停止。此外,通过一个一阶全变差项将校准混合分布转移到声明的部署混合分布,使证书在分布偏移下依然有效。实验在多个数据集、隐私预算和策略组合下进行:未出现任何同时违反边界的情况。然而认证的实际效力高度依赖分数和总体分布——主要目标 r*=0.10 在全部设置中均未得到认证,RAGTruth 上 r*=0.20 也未认证;但在 HaluEval 问答任务中,200 次非私有试验全部成功认证,且留出风险低于目标。作为对照,天真地私有化非私有证书会在 146 至 198 次试验中违反边界,凸显了联合设计的必要性。此外,作者探索了私有投注资本启发式方法,但未证明其 e-process 有效性,该启发式在 epsilon<=4 时停止认证,而 Fed-SRC 仍能继续。代价方面,认证消耗的流事件数约为唯一校准项数量的 30 倍。总体而言,本文的贡献在于首次将私有、联邦、任意时间保证组合成统一的认证框架,而非单独改进对比统计量或接受下限。

💡 推荐理由: 该研究为联邦场景下部署 RAG 系统的风险控制提供了可验证的统计保证,使安全团队能够在保护数据隐私的同时,对模型输出的可靠性进行实时监控与认证,对构建可信 AI 基础设施具有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)