#information-theory

共收录 7 条相关安全情报。

← 返回所有主题
推荐 3.5
Conf: 50%
👥 作者: JacK Fitzsimons

本文研究了一个差分隐私中的基础问题:是否可以对较大的组提供更强的隐私保障?Pujol和Desfontaines曾提出,在发布直方图时,是否可以允许对大计数有更大的误差,从而利用这一松弛来更强地保护大组成员。本文在固定不相交组以及“添加或删除一个个体”的邻接关系下系统研究该问题。隐私预算v(n)依赖于受影响的计数n,是非增函数,并且必须在所有阶数上同时约束Rényi散度的两个方向——这是本文研究的基于计数的零集中差分隐私(zCDP)形式。原始严格相对误差条件在计数为零时无法满足,因此作者通过要求E|widehat{x}_i - x_i| < r * max{x_i, 1}来显式引入边界容忍度,同时不改变任何正计数上的要求。主要结果确定了组大小的最优依赖关系。上界方面,作者直接特化了现有的移位变换框架,得到的移位对数高斯机制具有认证预算v(n)=O_r(n^{-2})。下界方面,对于任意固定的0<r<1,任何满足相同正计数效用要求和基于计数的zCDP的机制必须满足v(n)=Ω_r(n^{-2})。因此,在修正的问题表述下,逆平方速率是最优的。进一步,通过多计数信息论论证,将大计数-小误差极限下的主导系数限制在π/(4e^2)与1/π之间,因子小于3。当r=1时,一种数据无关的发布在零隐私损失下满足修正后的条件。该工作为差分隐私中的组隐私保护提供了理论基础,证明了基于计数的隐私预算的最优缩放关系,对设计更精细的隐私保护机制具有指导意义。

💡 推荐理由: 本文给出了组隐私保护中隐私预算随组大小衰减的最优速率(逆平方),为差异化隐私机制设计提供了理论基准,有助于构建更细粒度的隐私保护系统。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu

本文从信息论角度系统分析了生成模型水印的取证能力。传统水印仅用于检测文本是否由机器生成,但本文提出水印还可用于用户归属(识别生成文本的用户)、隐藏载荷提取以及定位编辑后残留部分,这构成了一个“取证阶梯”(forensic ladder)。作者引入信息轮廓ν(t)=I(S;X_t|X_{<t}),该轮廓刻画了每个token关于秘密S(用户身份或载荷)所揭示的信息量。该轮廓的总和决定了归属和提取的样本复杂度,而其分布决定了定位能力;检测则不是由信息量而是由标记分布与无标记分布的距离决定。主要定理:对于统计上无失真的方案,在熵率为h的平稳遍历信源上,归属一个文本到N个用户之一需要Θ(log N/h)个token,这是首个紧致的多用户归属熵率定律(通过精确对齐实现)。自然碰撞计数分析会导致无界过估计;只有通过每个候选者自己的实际惊喜度(realized surprisal)设置阈值的解码器才能达到该速率,同时几乎不错误指责无辜用户。匹配的逆定理使得该定律双向成立。提取ℓ比特载荷需要Θ(ℓ/h)个token。存在两个真实间隙:一个Θ(log N)大小的窗口内,文本可证明是机器生成但无法归属;以及一个足迹-分辨率不确定性原理。在GPT-2、Pythia-410M和Qwen2.5上的实验恢复了预测的常数。

💡 推荐理由: 该工作为生成模型水印的取证能力提供了首个理论框架,界定了检测、归属、提取和定位所需的信息论下界,对安全从业者评估水印方案的实际安全性、设计可审计的生成模型系统具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sayedeh Leila Noorbakhsh, Hossein Khalili, Nader Sehatbakhsh

该论文聚焦于协作边缘-云推理场景中的隐私泄露问题。资源受限的设备通过将部分计算卸载到云服务器来利用大型语言模型(LLM),但中间激活值在传输过程中容易受到提示反转攻击,即攻击者从共享表示中重构原始用户输入。现有防御方法多依赖启发式扰动或经验调优,缺乏对隐私泄漏及其与效用、延迟约束之间相互作用的理论理解。作者提出了一种基于信息论的防御框架,通过学习隐私保护表示,明确最小化中间激活值与输入提示之间的互信息,同时维持计算约束下的任务效用。论文推导了提示重构误差的理论保证,刻画了隐私-效用的基本权衡,并建立了下游推理的token级准确率界限。进一步提出基于低维信息瓶颈的隐私适配器实现防御方法。在多种设置下的广泛实验表明,该方法在隐私-效用-延迟权衡上优于现有防御(攻击成功率降低最高35%),为私有高效的协作LLM推理提供了理论基础。适合对LLM隐私保护、边缘计算安全感兴趣的研究人员阅读。

💡 推荐理由: 首次从信息论角度为协作LLM推理中的提示反转攻击提供理论保障,提出的隐私适配器实现了可量化的隐私-效用权衡,对边缘-云协作场景下的数据隐私保护具有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jianwei Tai

本文研究代码大语言模型(Code LLM)在提示词扰动下的安全性与功能性之间的信息论权衡。作者将代码补全任务建模为从自然语言提示到代码输出的映射过程,提出了容量(Cap)和安全性(Sec)两个信息论量:Cap衡量生成代码与理想正确代码之间的互信息,即模型的功能容量;Sec衡量扰动提示下生成代码与原始提示下生成代码之间的互信息,即扰动保留量。文中证明了Cap + Sec ≤ H(c^*) + I(p; ̃p)的理论上界,其中H(c^*)是任务熵,I(p; ̃p)是提示扰动引入的泄漏。通过确定性嵌入推论得到了隐藏状态版本,并利用tokenizer/gzip边界给出了模型无关的任务熵上限。实验部分,作者在两个模型(CodeLlama和Qwen)、两个数据集(HumanEval和MBPP)、两种精度(INT4/BF16)以及多种估计器消融下,验证了嵌入检查不等式成立,饱和度为0.27-0.92,定理松弛为2.36-26.94 nats。此外,提出了上下文混合余弦相似度作为生成-提示对齐信号,与pass@1具有显著相关性(如CodeLlama-HumanEval中ρ=0.36, p<0.0001)。自适应压力测试(包括23种扰动池、固定通用后缀和提示嵌入PGD)均留下正松弛,表明当前模型远未达到理论安全预算上限。本文为评估和提升代码LLM对提示扰动的鲁棒性提供了理论框架。

💡 推荐理由: 该研究从信息论角度量化了代码LLM在功能与安全性之间的根本权衡,为理解提示注入等攻击提供了理论基础,并给出了模型无关的安全预算上限,有助于设计更鲁棒的代码生成系统。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mohamed Nomeir, Shreya Meel, Sennur Ulukus

本文重新定义了私有信息检索(PIR)问题中的隐私概念,以容纳灵活的隐私需求。传统PIR要求用户检索消息时,对所有服务器隐藏被检索的消息索引。然而,实际场景中可能不需要如此严格的隐私保护。作者聚焦于图复制PIR系统,其中每个服务器仅存储部分消息,且存储模式由某种图结构(如路径图或循环图)决定。他们引入了一个通用隐私需求集:对于每个服务器,可以指定其需要隐藏的消息索引子集(不必是所有消息),只要该服务器的存储消息索引包含在隐私需求集中即可。由于存储设置和隐私需求集有多种可能,论文重点分析了路径图和循环图两种存储拓扑,并针对每种拓扑考虑了多种隐私配置,例如隐私需求集仅包含某个邻域范围内的消息索引。通过引入邻域范围参数,实现了从局部PIR到标准图复制PIR的平滑过渡。作者推导了这些场景下的容量界或精确容量,揭示了隐私强度与通信开销之间的权衡关系。该工作为设计灵活、高效的PIR系统提供了理论基础,尤其适用于分布式存储和隐私保护通信等场景。适合对隐私计算、信息论和安全存储感兴趣的研究人员阅读。

💡 推荐理由: 该研究提供了一种灵活调整隐私级别的PIR框架,使得在实际部署中可以根据安全需求和性能约束定制隐私保护强度,有助于平衡隐私与效率,对于构建隐私友好的分布式存储系统具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Shreya Meel, Mohamed Nomeir, Sennur Ulukus

本文重新审视了多服务器、图复制私人信息检索(PIR)系统中的隐私定义,提出了一种新的设置,其中用户的隐私由服务器的存储结构决定。具体而言,当用户从某个服务器检索消息时,只有当该服务器存储了该消息时,用户才关心隐藏其所需消息的索引。作者将这种隐私需求称为本地用户隐私,并将由此产生的PIR问题称为图上的本地PIR。目标是建立本地PIR的容量,即每下载一个符号可检索的最大消息符号数,从而衡量其与经典PIR相比的通信效率增益。研究发现,对于不相交的图的并集,本地PIR容量相比经典PIR容量有显著的倍增增益,特别是当各子图相同时。对于连通图,作者提出了方案来建立边传递图和二部图的下界,这些下界高于已知的最佳经典PIR容量界。最后,推导了循环图和奇数顶点的路径图的精确本地PIR容量。本文主要贡献在于提出了一种更细粒度的隐私模型,并揭示了图结构对PIR通信效率的有利影响,为分布式存储系统中的隐私保护提供了新思路。

💡 推荐理由: 该研究重新定义了多服务器环境下的隐私边界,强调用户只需对实际存储数据的服务器隐藏查询,而非所有服务器,从而显著提升通信效率。这为分布式存储、去中心化网络中的隐私保护协议设计提供了新方向。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rong Wang, Zhen Ling 0001, Guangchi Liu, Shaofeng Li 0001, Junzhou Luo, Xinwen Fu

本文提出了一种高效的网站指纹防御方法,通过迭代互信息最小化(Iterative Mutual Information Minimization, IMIM)来降低流量分析攻击的有效性。网站指纹攻击利用加密流量的统计特征(如数据包长度、时间间隔、方向等)来识别用户访问的网站,严重威胁隐私。现有防御方法(如随机填充、流量变形)往往牺牲带宽或延迟,且效果有限。作者将防御问题建模为在保留流量基本功能的前提下最小化原始流量与伪装流量之间的互信息,从而去除与网站身份相关的敏感特征。具体地,设计了一个基于变分信息瓶颈的迭代优化框架,交替更新编码器(伪装生成器)和攻击判别器,逐步压缩冗余信息。实验使用Tor流量数据集评估,与多种防御(如WTF-PAD、Glue、TamAR)对比。结果显示,IMIM在相同带宽开销下将攻击准确率从90%以上降至30%以下,且延迟增加小于10%。该方法还可迁移到其他加密应用场景,表明其通用性。本文适合网络隐私研究者、流量分析防御工程师阅读。

💡 推荐理由: 网站指纹攻击是Tor等匿名网络的主要威胁之一,现有防御要么效率低要么开销大。本文提出基于互信息最小化原则的通用防御框架,为实际部署提供新思路。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)