#membership-inference

共收录 26 条相关安全情报。

← 返回所有主题
推荐 11.6
Conf: 50%
👥 作者: Rui Wen 0002, Zheng Li 0023, Michael Backes 0001, Yang Zhang 0016

本文首次提出针对大语言模型(LLM)上下文学习(In-Context Learning, ICL)场景的成员推理攻击(Membership Inference Attack)。ICL作为一种参数高效的适配方法,通过提供少量示例即可让LLM适应新任务,但其隐私风险在现实假设下尚缺乏系统研究。作者设计了四种攻击策略,分别适应不同的受限场景(如仅能访问模型生成的文本、无需概率输出等),并在四个主流LLM上进行了广泛实验。实验结果表明,所提攻击在大多数情况下能准确判断某条数据是否为模型训练成员,例如针对LLaMA模型,攻击准确率优势达到95%,远高于基于概率的现有攻击。此外,作者提出一种混合攻击,综合各策略优势,在多数场景下准确率优势超过95%。最后,作者从数据、指令和输出三个正交维度提出了三种防御方法,综合使用这些防御可以显著降低隐私泄露风险,提供更强的隐私保障。该研究揭示了ICL在隐私保护方面的严重脆弱性,为后续隐私保护研究提供了重要基础。适合关注LLM隐私安全、成员推理攻击防御的学者和安全工程师阅读。

💡 推荐理由: 上下文学习(ICL)是LLM高效适配的主流范式,但本文首次证明仅凭生成文本即可高精度推断成员关系,隐私风险远高于以往认知。蓝队需评估ICL场景下的数据泄露暴露面,并考虑多维防御措施。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xukun Luan, Jinyan Liu, Yuhui Gong, Yuanguo Bi, Bing Hu, Xuesong Li, Di Wang

本文提出 MemCatalyst,一套针对视觉-语言模型(VLM)的数据投毒工具,旨在增强数据审计(尤其是成员推断攻击)的效果。研究背景是:VLM 依赖海量互联网数据训练,数据持有者(如艺术家)担心其数据未经授权被用于训练,涉及知识产权和隐私问题。成员推断(MI)作为直接的数据审计手段受到关注,但直接在 VLM 上执行审计的准确率有限。MemCatalyst 核心思路是在训练数据中注入精心构造的毒化样本,迫使模型过度学习图像特征与文本语义之间的特定不一致性,从而放大模型对成员信息的可审计性。方法包括两种策略:文本投毒(PT)和图像投毒(PI),并验证了毒化样本在不同 VLM 架构间具有迁移性,可在黑盒设置下生效。实验基于两个主流 VLM 和五种最新数据审计方法,显示 MemCatalyst 能以极少的毒化样本预算显著提升 MI 的 AUC 分数,同时几乎不影响模型正常性能。本文适合关注数据隐私、模型审计、AI 安全的研究人员,以及需要评估训练数据合规性的安全从业者。注意:本摘要仅基于论文摘要,未验证实验细节和代码可用性。

💡 推荐理由: 该研究揭示了攻击者可通过投毒放大成员推断风险,对依赖公开数据训练 VLM 的合规审计提出新挑战,帮助蓝队理解数据审计的局限性并加强训练数据治理。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: David Amebley, Sayanton V. Dibbo

本文研究多模态视觉-语言模型(VLMs)在成员推断攻击(Membership Inference Attack, MIA)下的隐私泄露问题。随着智能体AI(agentic AI)的发展,多模态模型(MMs)被广泛部署,但其训练数据可能通过黑盒攻击被泄露。现有研究主要针对单模态AI系统的隐私攻击,而对多模态系统关注不足;同时,神经启发(neuro-inspired)的表示方法已被证明能提升单模态模型对对抗攻击的鲁棒性,但尚未有工作验证其对隐私攻击是否同样具有韧性。作者提出了一种基于神经科学的拓扑正则化(topological regularization, tau)框架,用于系统分析多模态VLMs对图文推理隐私攻击的韧性。实验采用三种VLM(BLIP、PaliGemma 2、ViT-GPT2)和三个基准数据集(COCO、CC3M、NoCaps),对比基线模型与使用拓扑正则化的NEURO变体(tau>0)。结果表明,在BLIP模型和COCO数据集上,NEURO VLM的MIA攻击成功率(以ROC-AUC衡量)平均下降24%,同时通过MPNet和ROUGE-2指标评估,其生成的图像描述与参考描述相似度与基线相当,即模型效用没有显著损失。在PaliGemma 2和ViT-GPT2模型以及CC3M、NoCaps数据集上的扩展实验进一步验证了结论的一致性。这项工作增进了对多模态模型隐私风险的理解,并首次提供了神经启发多模态模型对隐私威胁具备韧性的证据。适合AI安全研究员、隐私保护工程师、多模态模型开发者和关注机器学习隐私的从业者阅读。

💡 推荐理由: 这是首个系统研究神经启发多模态VLM对成员推断攻击韧性的工作,证明了拓扑正则化可大幅降低隐私泄露风险而不牺牲效用,为构建隐私友好的多模态AI提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 9.5
Conf: 50%
👥 作者: Depeng Chen, Xiao Liu, Jie Cui 0004, Hong Zhong 0001

本文研究机器学习模型中的成员推断攻击(Membership Inference Attacks, MIAs)。传统MIA利用模型对训练数据存在过拟合或记忆效应,通过分析模型输出判断某个数据样本是否属于训练集。然而,在真实场景中,攻击者通常难以获得大量带有准确成员身份的标注样本,因为现实应用中大多数样本并非训练成员,导致现有攻击方法因缺乏足够有质量的数据而效果受限。针对这一局限,作者提出一种名为CLMIA的新攻击方法,核心思想是采用无监督对比学习(Contrastive Learning)来训练攻击模型。该方法首先利用大量未标记数据通过对比学习学习样本表示,然后仅需少量已知成员状态的样本对攻击模型进行微调,即可实现有效的成员推断。实验采用ROC曲线评估性能,结果表明在低误报率(FPR)条件下,CLMIA相比其他方案能达到更高的真正例率(TPR),说明其攻击有效性和数据效率均优于现有方法。本文以海报形式发表于学术会议,属于隐私攻击研究领域。

💡 推荐理由: 成员推断攻击直接威胁机器学习模型的训练数据隐私,本方法降低了攻击者对标注样本的需求,使攻击更具现实可行性,提醒模型部署者重视隐私泄露风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhiqi Wang, Chengyu Zhang, Yuetian Chen, Nathalie Baracaldo, Swanand Ravindra Kadhe, Lei Yu 0002

该论文针对机器学习模型隐私评估中广泛使用的成员推断攻击(Membership Inference Attacks, MIAs)展开系统研究。现有MIA研究主要聚焦于提升AUC、准确率、TPR@低FPR等性能指标,或利用这些指标评估隐私保护方案,但普遍忽略了不同攻击之间的差异。作者指出,这些差异既存在于不同攻击方法之间,也存在于同一方法的多次实例化之间,对MIA作为隐私评估工具的可信度和完整性具有关键影响。为此,论文提出一个基于覆盖率和稳定性分析的新框架,系统性地研究这些差异。大量实验揭示了MIA中显著的差异性、其潜在成因以及对隐私评估的广泛影响。针对上述挑战,论文进一步提出一个集成框架,包含三种不同策略,以在利用现有最先进MIA优势的同时兼顾其差异性。该集成框架不仅能构建更强力的攻击,还为隐私评估提供了更稳健、更全面的方法论。这项工作对于依赖MIA进行模型隐私审计、机器遗忘验证和隐私法规合规的从业者具有重要参考价值,有助于更准确地解读MIA结果并避免因单一攻击方法的偏差而得出误导性结论。

💡 推荐理由: MIA常被当作隐私评估的“标准工具”,但该研究揭示其内部存在显著差异,可能影响审计结论的可靠性。了解这些差异与集成对策,有助于蓝队更准确地评估模型隐私泄露风险。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ali Naseh, Yuefeng Peng, Anshuman Suri, Harsh Chaudhari, Alina Oprea, Amir Houmansadr

本文研究检索增强生成(RAG)系统中的成员推断攻击(Membership Inference Attack, MIA)问题。RAG 通过将外部知识库中的文档检索结果注入到大语言模型的上下文中,实现无需调整模型参数的接地生成。尽管不更新权重避免了通过模型参数泄露训练数据,但检索到的文档本身可能被攻击者利用,构成新的隐私泄露面。已有的成员推断和数据提取方法通常依赖越狱提示或精心构造的非自然查询,容易被 RAG 系统中常见的查询改写技术检测或拦截。为此,作者提出一种名为“审讯攻击”(Interrogation Attack, IA)的新型成员推断技术,专门针对 RAG 数据存储中的目标文档。其核心思想是构造自然语言查询,使得只有目标文档出现在上下文中时该查询才能被正确回答,从而以黑盒方式推断文档是否在数据库中。实验表明,该攻击仅需 30 次查询即可完成单文档推断,且隐蔽性显著优于现有方法:常规检测器对已有攻击生成的对抗提示的识别频率是对 IA 生成提示的约 76 倍。在多种 RAG 配置下,IA 在 1% 假阳性率下的真阳性率(TPR@1%FPR)相比先前推断攻击提升 2 倍,而单文档推断成本低于 0.02 美元。该研究揭示了 RAG 系统中“通过上下文泄露”的新隐私风险,凸显了检索端防御的重要性。适合关注 LLM 隐私、RAG 安全及对抗机器学习的蓝队研究人员阅读。

💡 推荐理由: RAG 已成为企业级 LLM 应用的标配,本文首次展示了仅用自然查询即可对文档库进行高隐蔽性成员推断,成本极低,威胁到机密数据库的保密性,蓝队需重视检索环节的隐私风险。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Victor Maricato

本论文针对黑盒语言模型训练数据泄露问题,提出了基于概率视角的成员推断(MIA)审计方法,并批判了传统聚合指标(如ROC-AUC)的误导性。作者首先指出,现有的MIA评估常被无模型盲基线混淆,这类基线仅通过表面文本特征就能较好区分成员与非成员,从而高估了模型实际泄露。通过将采样视为对输出分布的估计,并利用其泛函定义泄露信号,论文在WikiMIA和IID Pile分割上验证了盲基线的强大(WikiMIA上盲词袋分类器AUC达0.97,且采样不增加收益),同时揭示采样在逐文档提取中能发现真实危害。在Pythia系列模型上,实验表明:500个Pile文档中16.6%的文档携带的真实标识符(如邮箱)可被精确提取,并通过错配前缀对照证明泄漏归因于特定文档;泄漏比例随模型容量从410M的5.6%增至6.9B的16.6%。风险分布不均:代码域中标识符泄露强度约为散文域的3倍,且散文域仍有明显正向信号(4.0%到12.1%);任意保留连续文本的恢复仅显著出现在代码域。温度与核采样影响甚微,16个token前缀即足够,语料去重也未显著降低泄露。论文的核心贡献是发布leakit——一个黑盒提取审计工具,并主张隐私审计应报告按领域分解的逐文档提取率,而非单一聚合AUC。该研究为LLM隐私评估提供了更精确的方法论,适合模型部署方、安全审计人员及AI治理研究者阅读。

💡 推荐理由: 该研究揭示聚合AUC掩盖真实训练数据泄露,尤其是唯一标识符(如邮箱)可被逐文档提取,且随模型规模增大而加剧;对LLM隐私合规和AI安全审计具有直接参考价值。

🎯 建议动作: 纳入内部隐私与安全评估流程,研究leakit工具并结合自身模型进行试点审计

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaoyong Yuan, Lan Zhang 0005

本文首次系统研究了神经网络剪枝过程中的隐私风险,特别是成员推理攻击(Membership Inference Attacks)的影响。作者指出,现有的剪枝研究主要关注如何在保持模型精度的同时提高稀疏性,但忽略了剪枝可能带来的训练数据记忆化风险。通过实验,他们发现剪枝过程会导致模型在成员(训练集数据)和非成员(非训练集数据)上的预测行为产生差异(即预测发散),并且这种发散在不同类别上表现不同。基于此观察,作者提出了一种基于自注意力机制的成员推理攻击方法,专门针对剪枝后的神经网络。该攻击利用剪枝导致的预测发散,通过自注意力权重聚焦于发散显著的样本,从而更准确地推断数据是否属于训练集。实验表明,该方法在多个剪枝方法、稀疏度水平和攻击知识假设下,均优于现有的八种成员推理攻击。此外,作者还提出了一种基于KL散度的防御机制,通过最小化剪枝前后模型预测分布的差异来缓解预测发散,从而保护隐私。实验证明,该防御在保持模型稀疏性和精度的同时,有效降低了成员推理攻击的成功率。该研究适合AI安全研究人员、隐私保护工程人员以及模型压缩领域的从业者阅读。

💡 推荐理由: 模型剪枝广泛用于边缘部署,但本文揭示其可能加剧数据记忆,导致训练数据隐私泄露。对设计隐私友好的模型压缩方案至关重要。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Guilin Deng, Silong Chen, Yuchuan Luo, Yi Liu 0057, Songlei Wang, Zhiping Cai, Lin Liu 0018, Xiaohua Jia, Shaojing Fu

本文针对联邦大语言模型(FedLLMs)中的成员推断攻击(MIA)问题展开研究。FedLLMs允许多方协作微调大语言模型而无需共享原始数据,从而解决资源有限和隐私保护等挑战。然而,即使数据不离本地,共享的梯度仍然可能通过成员推断攻击泄露敏感信息。由于FedLLMs具有参数规模巨大、收敛速度快、梯度稀疏且非正交等独特特性,现有的MIA方法效果不佳。为此,作者提出了ProjRes——首个针对FedLLMs的基于投影残差的被动成员推断攻击方法。ProjRes将隐藏嵌入向量作为样本表示,并分析它们在梯度子空间上的投影残差,以揭示梯度与输入之间的内在联系。该方法不需要影子模型、辅助分类器或历史更新,因此效率高且鲁棒性强。在四个基准测试和四个大语言模型上的实验表明,ProjRes达到了接近100%的准确率,比之前的方法性能提升了高达75.75%,即使在强差分隐私防御下仍然有效。该研究揭示了一个先前被忽视的FedLLMs隐私漏洞,并呼吁重新审视其安全假设。代码和数据已公开。

💡 推荐理由: 本文首次实现了对联邦大语言模型的高效、高精度成员推断攻击,暴露了当前隐私保护机制的不足,对联邦学习场景下的用户隐私构成实质性威胁,值得安全社区关注。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Sahasrajit Sarmasarkar, Anastasia Koloskova, Sanmi Koyejo

本文针对机器学习模型遗忘算法是否真正消除了训练数据影响的问题,提出了一种实用的审计方法。研究者设计了一个基于成员推断攻击的审计器,通过计算与数据相关的遗忘参数ε的下界,来评估遗忘算法是否达到其声称的隐私保证。在CIFAR-100和Shakespeare文本数据集上测试了多种遗忘算法,发现具有严格理论保证的算法(如模型剪枝、回退删除)能实现非常小的ε界,与它们的遗忘保证一致;而经验性方法(如基于Hessian的遗忘、交替上升-下降、遗忘集上升、保留集微调)则显示出较大的ε界,表明遗忘效果不佳。该审计器通过假设检验框架,为经验性地证伪遗忘声明提供了实用工具。这项工作对隐私保护机器学习领域具有重要价值,为第三方审计遗忘算法提供了可操作的方法。

💡 推荐理由: 提供了一种实用的遗忘算法审计工具,帮助安全从业者验证模型是否真正消除了用户数据影响,对于满足隐私法规和数据删除权至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Qirui Huang, Na Li, Hongsheng Hu, Zhi Zhang, Anmin Fu, Yansong Gao

本文首次系统地研究了“单数据集多模型”(ODMM)范式下的隐私放大风险。在ODMM中,同一个数据集(如人脸或医疗图像)被重复用于训练多个模型,每个模型独立部署为API服务以完成不同任务(如人脸识别、年龄估计、种族分类)。现有隐私研究工作多关注单个模型泄露,而忽视了多模型共同暴露带来的累积效应。作者首先建立了理论框架,证明隐私泄露会随暴露的ODMM模型数量增加而累积(称为ODMM隐私组合)。基于该理论,他们提出了PRIME方法,通过黑盒访问多个ODMM模型,聚合各模型泄露的隐私信号,并利用元分类器联合推断给定样本的成员身份。实验在五个隐私敏感的数据集(涵盖人脸分析、医学影像、文本归因分析三个领域)和多种模型架构(ResNet、ViT、Qwen3-1.7B)上进行,结果表明数据集在多模型间重用显著放大了隐私风险,PRIME攻击性能稳定优于单任务成员推理攻击。文中还探讨了差分隐私等缓解措施,但其代价是效用损失,且PRIME仍能超越单任务基线。该工作对多模型部署场景的隐私风险评估具有重要指导意义。

💡 推荐理由: 安全从业者需注意:当同一数据集被用于训练多个模型并分别暴露时,隐私泄露风险并非线性叠加而是显著放大。本文首次量化了这种累积效应,并提供了可操作的评估方法(PRIME),有助于在实际部署中重新审视多模型系统的隐私保护策略。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Dayong Ye, Tainqing Zhu, Kun Gao, Junhao Liu, Yichuan Chen, Shuai Zhou, Hengzhu Liu, Bo Liu, Wanlei Zhou

本文提出首个统一框架,用于对文本生成、文本到图像、图像到文本三种模态的生成模型进行成员推理攻击(MIA)。现有方法针对单一模态设计,无法跨模态适用。作者发现一个模态无关的观察:生成模型的输出分布可近似其训练数据分布。利用这一特性,他们在共享嵌入空间中建模模型生成输出与辅助非成员样本的分布,通过似然比检验进行成员推理。在严格黑盒设置下(部分知识/零知识威胁模型),针对微调数据和预训练数据进行了广泛实验。结果表明,该方法在跨模态场景下优于针对单一模型类优化的现有最先进方法。这是首个跨模态统一MIA研究,为评估生成模型隐私风险提供了通用工具。

💡 推荐理由: 该研究揭示了生成模型在跨模态场景下共享的隐私泄漏模式,为防御者提供了一种统一评估成员隐私风险的方法,有助于设计更全面的隐私保护机制。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yan Pang, Tianhao Wang 0001

本文针对近年流行的扩散模型(diffusion models)提出了一种新的黑盒成员推理攻击(Membership Inference Attack, MIA)框架。随着预训练扩散模型的高质量发布,越来越多的用户下载这些模型并使用下游数据集进行微调,这带来了显著的隐私泄露风险。作者首次基于分数(scores-based)设计了适用于扩散模型的成员推理攻击,并在更严格的黑盒访问设置下进行。该框架考虑了四种不同的攻击场景和三种攻击类型,能够针对任何流行的条件生成器模型,实现了高达0.95的AUC(Area Under Curve)精度。代码已开源。研究揭示了扩散模型在下游任务微调中的隐私脆弱性,为后续防御研究提供了基准。

💡 推荐理由: 首次系统性地针对扩散模型提出黑盒成员推理攻击,展示了微调下游任务中严重的隐私泄露风险,对模型安全部署和隐私保护研究具有重要警示意义。

🎯 建议动作: 研究跟进:将该攻击作为隐私风险评估的基线,开发相应的防御机制。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rui Wen 0002, Michael Backes 0001, Yang Zhang 0016

本论文研究了机器学习中数据重要性(data importance)与各类攻击脆弱性之间的关系。尽管已有工作表明不同训练样本对模型效用的贡献存在差异,但“高价值数据是否更容易受到攻击”这一关键问题尚未被系统回答。作者分析了五种典型攻击类型(包括成员推断、模型窃取等),发现高重要性样本在成员推断和模型窃取攻击中表现出更高的脆弱性。具体而言,通过将样本特征整合到成员指标中(引入样本特定标准),成员推断的性能得到显著提升。该发现揭示了数据价值与攻击风险之间的正向关联,强调了在设计防御机制时需要平衡模型效用与高价值数据保护。实验部分对多种数据集和模型架构进行了验证,结果表明该现象具有普遍性。论文的核心贡献在于首次系统性地量化了数据重要性对不同攻击类型的影响,并提出了利用重要性信息增强成员推断的新思路。适合机器学习安全、隐私保护领域的研究者和安全工程师阅读。

💡 推荐理由: 揭示了高价值训练样本更容易成为攻击目标,为数据分类保护、差异化防御策略提供了理论依据,有助于优先保护关键数据。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Dongdong Zhao, Jinrong Hu, Changtian Song, Jian Chen, Hongmin Wang, Baogang Song

本文针对黑盒成员推理攻击(MIAs)中存在的查询效率问题,提出了一种预查询样本选择框架PSS-MIA。传统的黑盒MIAs对所有候选样本不加区分地进行查询,导致大量查询成本浪费在信息量低的样本上,且增加了查询暴露风险。作者首先定义了问题:哪些候选样本值得查询?PSS-MIA分为两个阶段:第一阶段使用提出的Loss-Gap Ranking(LGR)方法,通过参考模型计算候选样本的损失差(loss gap),估计其成员信号强度,据此对样本排序并筛选出子集;第二阶段仅对选中的样本进行目标模型查询,并将返回结果用于任意现有的黑盒MIA方法。在CIFAR-10、CIFAR-100和CINIC-10数据集上,结合五种代表性黑盒MIA方法(如LiRA、RMIA等)的实验表明,PSS-MIA在保持或提升推理精度的同时,显著降低了查询预算:在0.1%假阳性率(FPR)约束下,分别节省至少83.1%、60.6%和80.4%的查询次数。研究贡献在于提出了一个通用、即插即用的样本选择框架,揭示了样本非均匀成员信号特性,并提供了理论上的排序依据。适合关注机器学习隐私攻击与防御的研究人员、模型发布者以及AI审计团队阅读。

💡 推荐理由: 该研究揭示了成员推理攻击中查询资源的非高效利用问题,提出的预选择框架可被防御方反向利用来设计更高效的对抗措施或降低自身模型被攻击时的暴露风险。

🎯 建议动作: 研究跟进,评估该框架对自身模型成员推理攻击风险的增强效果,并考虑部署查询日志分析以检测异常样本选择模式。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tânia Carvalho, Maxime Cordy

本文研究了表格基础模型(tabular foundation models)中注意力机制的隐私漏洞。尽管这些模型通常在合成数据上预训练,被认为隐私风险较低,但它们采用上下文学习(in-context learning),在推理时可能直接包含敏感记录作为标注的上下文示例。论文提出了一种基于注意力机制的成员推理攻击(AMIA),该攻击无需影子模型,利用Transformer注意力模式的集中性来推断特定记录是否属于训练集。实验表明,注意力机制泄露了强烈的成员信号,在低假阳性率下平均攻击成功率比传统的基于置信度的攻击高出7.7%。为缓解风险,作者提出了一种基于k-匿名原则的推理时防御方法,通过降低上下文键表示的独特性(不添加随机噪声或重训练模型),仅针对AMIA得分识别的高风险查询进行保护。该防御能将AMIA攻击的成员泄露平均降低50%,对基于置信度的攻击降低25%,同时仅造成3.9%的性能下降。论文还发现,微调会引入额外的隐私风险:微调后预测置信度升高的样本更容易受到成员推理攻击,表明微调可能加剧记忆化并通过置信度变化暴露敏感训练信息。

💡 推荐理由: 揭示了表格基础模型在上下文学习中的隐私漏洞,特别是注意力机制引发的成员推理风险,并提出了有效的轻量级防御方法。对使用表格预训练模型的隐私合规团队和安全工程师具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 14.6
Conf: 50%
👥 作者: Zhikun Zhang 0001, Min Chen 0032, Michael Backes 0001, Yun Shen, Yang Zhang 0016

该论文首次系统性地分析了图神经网络(GNN)在节点级成员推断攻击下的隐私风险。GNN广泛应用于社交网络、蛋白质结构等图数据,但先前对隐私攻击的研究主要集中在欧几里得数据(如图像和文本)上,GNN的隐私漏洞尚未被充分探索。作者定义了三种威胁模型,基于攻击者的背景知识强度:仅知道图结构和部分节点标签、知道目标节点子图、知道完整图结构。针对这些模型,提出了三种成员推断攻击方法,利用节点嵌入的过拟合特性及图结构信息。在三个经典GNN架构(GCN、GraphSAGE、GAT)和四个基准数据集(Cora、Citeseer、Pubmed、Facebook)上评估,结果显示即使攻击者仅有最小背景知识,GNN也显著泄露节点成员信息。实验进一步表明,图的密度和节点特征的相似性对攻击成功率有重要影响:高密度图或高特征相似性会增加攻击风险。最后,作者探索了两种防御机制——差分隐私训练和图扰动,并发现它们能降低攻击性能,但会以适度牺牲模型效用为代价。该工作对理解GNN隐私风险并设计防御策略具有重要意义。

💡 推荐理由: GNN广泛应用于敏感图数据,但成员推断攻击可能泄露节点是否在训练集中,导致隐私泄露。该研究首次系统揭示此风险,对安全从业者评估GNN部署的隐私威胁至关重要。

🎯 建议动作: 研究跟进: 评估自身GNN模型对成员推断攻击的脆弱性,考虑部署差分隐私或图扰动等防御。

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 11.5
Conf: 50%
👥 作者: Lorenzo Rossi, Michael Aerni, Jie Zhang 0107, Florian Tramèr

本文针对序列模型(如大型语言模型和自回归图像生成器)中的成员推断攻击进行了研究。序列模型在训练过程中往往会记忆训练数据中的敏感信息,并在生成过程中无意泄露这些信息,这带来了严重的法律和隐私风险。然而,现有的隐私审计工具由于假设与序列生成过程的特性不匹配而效果有限。作者提出,有效测量序列模型中的隐私泄露需要利用序列生成过程中固有的样本内相关性。为此,他们改编了最先进的成员推断攻击,通过显式建模序列内的相关性,将现有攻击自然地扩展以适应序列模型的结构。具体地,他们针对自回归序列生成的特点,在攻击中引入了一个能够捕获序列内依赖关系的统计量,从而更准确地判断一个样本是否出现在训练集中。通过案例研究(可能针对语言模型或图像生成模型),实验证明这种改进能够持续提高记忆审计的有效性,且不会增加额外的计算成本。本文的工作为大型序列模型的可靠记忆审计奠定了重要基础,对于理解和缓解序列模型中的隐私泄露风险具有指导意义。

💡 推荐理由: 序列模型(如LLM)广泛部署,成员推断攻击可导致训练数据中敏感信息泄露,引发法律和合规问题。本文提出的改进审计方法能更准确评估隐私风险,对安全从业者制定隐私保护策略至关重要。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 8.5
Conf: 50%
👥 作者: Sinan Yıldırım, Megha Khosla

针对图神经网络(GNN)的现有隐私分析大多继承自非图数据场景的假设,忽略了结构依赖性和随机训练图采样。尤其是节点相关的先验导致仅凭第一类和第二类错误无法充分刻画最佳成员推断测试。为此,本文提出贝叶斯成员隐私(BMP),一种采样感知的节点级成员隐私定义,将节点相关的先验和图采样概率纳入攻击者知识。BMP将成员推断建模为贝叶斯假设检验,并通过后验成员概率量化成员隐私。论文探讨了BMP与现有定义之间的理论关系,并进一步提出一种实用的、采样感知的审计机制来估计BMP参数,作为GNN节点级隐私泄露的度量。在基准图数据集上的实验表明,BMP能提供比全局攻击精度更细粒度的隐私洞见。

💡 推荐理由: 现有GNN隐私分析忽略图结构特殊性,BMP首次从贝叶斯角度统一节点先验和采样不确定性,为评估成员泄露提供了更准确的理论基础。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Lisa Oakley, Sam Stites, Cameron Moy, Steven Holtzen, Alina Oprea, Marco Gaboardi

本文研究在统计发布场景下的成员推理攻击(Membership Inference Attack, MIA)问题。现有攻击通常仅利用数据集的边缘分布来建模总体,并假设总体服从独立同分布或乘积分布,这忽略了属性之间的依赖关系,从而限制了攻击效果。作者提出一种基于贝叶斯网络的框架,将总体建模为贝叶斯网络(BN),使得攻击者可以利用先验知识(如人口属性依赖结构)发起更有效的定制化攻击。该框架将成员推理问题重新定义为贝叶斯决策问题,并引入概率编程语言Roulette实现贝叶斯后验计算的具体攻击实例。理论证明表明,该攻击在具有强属性依赖的两个总体下等价于最优的似然比检验攻击变体。实验基于五个常用贝叶斯网络数据集,比较了似然比检验和内积攻击等基线方法,结果表明所提方法在总体依赖结构复杂、现有攻击难以手动适配的场景下显著优于基线。本文主要贡献包括:形式化了考虑属性依赖的成员推理问题、设计了基于贝叶斯决策的通用框架、提供了概率编程实现的理论与实验验证。适合从事差分隐私、统计发布安全、以及对抗性机器学习的研究人员阅读。

💡 推荐理由: 本文揭示了忽视属性依赖的传统成员推理攻击可能低估实际隐私风险,提出的贝叶斯攻击框架更贴近真实攻击者的先验知识,为差分隐私系统的安全性评估提供了新视角。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Kai Chen, Yan Pang, Tianhao Wang

本文聚焦于聊天代理(chat agent)记忆系统中的成员推断攻击(MIA)。现有MIA研究主要针对训练语料库或检索数据库,但代理记忆包含敏感的用户-代理交互、检索事实和用户偏好,其隐私泄露风险尚未被充分探索。作者提出了一种统一的攻击方法——多召回记忆MIA(MRMMIA),利用多个召回探针(multiple recall probes)从代理中提取成员信号,覆盖黑盒、灰盒和白盒三种设定。实验结果显示,MRMMIA在多个指标上持续优于基线方法。该研究首次系统性地评估了聊天代理记忆系统的成员泄露风险,为相关隐私评估提供了初步框架。主要贡献包括:定义了代理记忆MIA问题、提出了可跨设定使用的通用攻击方法、以及通过实验揭示了代理记忆的隐私脆弱性。适合关注大语言模型隐私、系统安全的研究人员和工程师阅读。

💡 推荐理由: 随着聊天代理广泛应用,其记忆模块可能存储敏感用户信息。该研究首次系统性地揭示了代理记忆面临成员推断攻击的风险,对隐私合规与安全设计有重要启示。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Joonas Jälkö, Gauri Pradhan, Ossi Räisä, Antti Honkela

本文研究成员推理攻击(MIA)在评估模型训练数据泄露时的可靠性问题。MIA通过二分类器预测样本是否属于训练集,通常使用假阳性率(FPR)和真阳性率(TPR)衡量漏洞。然而,可靠估计低FPR下的TPR需要大量目标模型,计算成本高昂。为了降低开销,现有工作常将多个个体和多个模型的MIA分数拼接后平均,然后评估TPR。本文指出这种高效评估流程存在两个关键缺陷:第一,拼接后的分数用于低FPR区域时,不同样本的FPR未得到校准,导致差分隐私审计不可靠;第二,Carlini等人(2022)提出的高效似然比攻击(LiRA)实现中存在有限总体偏差,使得每个样本的漏洞评估存在正向偏差。针对第一个问题,作者提出一种后处理方法,通过校准不同样本的FPR来提升可靠性。实验表明,该方法能有效修正评估偏差,使MIA评价更适用于差分隐私审计。本文适合从事隐私保护、差分隐私审计以及成员推理攻击评估的研究人员阅读。

💡 推荐理由: 揭示了当前高效成员推理攻击评估方法的漏洞,影响差分隐私审计的可信度,为更可靠的隐私泄露评估提供了重要改进方向。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Abtin Mahyar, Masoumeh Shafieinejad, Yuhan Liu, Xi He

该论文研究了针对表格扩散模型的成员推断攻击(Membership Inference Attack, MIA)。扩散模型在合成表格数据方面表现出色,常被用于共享敏感记录,但其隐私保护能力受到质疑。现有成员推断攻击通常假设单表设置,忽略了真实敏感数据中的多表关系结构。论文指出,在多表场景下评估隐私风险的核心挑战在于如何利用与目标表相关联的辅助信息(如其父表)。然而,在攻击推理时,攻击者只能观察到目标表中目标记录的属性值。为此,作者提出了FERMI(FEature-mapping for Relational Membership Inference)方法,通过将单表特征与关系成员信号相结合来解决这一差距。FERMI 首先在训练阶段利用辅助关系表学习一个特征映射,将多表关系转化为单表特征上的增强信号;在推理时仅需目标记录的属性值即可进行成员推断。实验基于三种表格扩散架构(如 CTGAN、TableDiffusion 等)和三个真实关系数据集(如 IMDB、Airbnb 等),评估了白盒和黑盒设置下的攻击性能。结果显示,FERMI 在假阳性率(FPR)为0.1时,真阳性率(TPR)在白盒设置下比单表基线提升高达53%,在黑盒设置下提升22%。论文的主要贡献在于首次将关系结构引入表格扩散模型的成员推断攻击,并提出了有效的特征映射方法,显著提高了攻击效果。该研究提醒数据发布者:即使在推理时仅释放单表数据,多表关系在训练阶段的存在仍可能被攻击者利用,从而加剧隐私泄露风险。适合从事数据隐私、机器学习安全的研究人员以及使用合成数据发布敏感信息的组织阅读。

💡 推荐理由: 揭示了表格扩散模型在多表关系场景中未被重视的隐私泄露渠道,为数据发布者评估合成数据的成员隐私风险提供了新视角,具有重要警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xue Tan, Hao Luan, Mingyu Luo, Zhuyang Yu, Jun Dai 0001, Xiaoyan Sun 0003, Ping Chen 0003

本文研究了针对开源大语言模型(LLMs)的成员推理攻击(Membership Inference Attack, MIA),即判断特定数据样本是否被用于模型训练。与现有基于模型输出(如loss、logits)的MIA方法不同,作者提出利用模型内部的神经激活(neural activations)来区分成员和非成员样本。具体地,他们设计了一种攻击方法,通过提取目标模型在特定层上的激活值,并训练一个二元分类器(如逻辑回归或MLP)来预测成员关系。实验在多个开源LLM(如GPT-2、LLaMA、OPT等)和多种数据集(如新闻、医疗、代码)上进行,结果表明基于激活的方法显著优于输出基方法,在低假阳性率下取得高召回率。此外,作者分析了不同模型层、不同样本长度对攻击性能的影响,并探讨了防御措施(如差分隐私训练、激活剪枝)的有效性。该研究揭示了LLM内部状态泄露训练数据的风险,为模型隐私评估提供了新工具。

💡 推荐理由: 该方法通过模型内部激活实现更精准的成员推理,对使用开源LLM的组织构成数据泄露风险,尤其涉及合规场景(如GDPR)。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Yuntao Du 0002, Jiacheng Li, Yuetian Chen, Kaiyuan Zhang 0002, Zhizhen Yuan, Hanshen Xiao, Bruno Ribeiro 0001, Ninghui Li 0001

本文提出了一种新型的成员推理攻击方法——级联代理成员推理攻击(Cascading and Proxy Membership Inference Attacks)。成员推理攻击旨在判断特定数据点是否被用于训练目标机器学习模型,对模型训练的隐私构成严重威胁。现有的攻击方法通常需要访问目标模型的输出或梯度,或者依赖影子模型进行黑盒攻击,但在黑盒场景下效率较低。本文提出的级联代理攻击方法通过构建多个代理模型来模拟目标模型的行为,并利用级联结构逐步提升攻击精度。具体而言,该方法首先训练一个初始代理模型,然后基于该模型对目标模型的输出进行预测,再使用这些预测作为标签训练下一级代理模型,从而逐步逼近目标模型的决策边界。实验在多个标准数据集(如CIFAR-10、ImageNet)和多种模型架构(如ResNet、CNN)上进行,结果表明该方法在攻击成功率上显著优于传统的单代理模型攻击和基于影子模型的攻击,尤其在目标模型参数不可见或仅提供有限输出信息的情况下。此外,该方法还展示了良好的可迁移性,即在一个数据集上训练的代理模型可以有效攻击其他相似数据集上的目标模型。本文的主要贡献包括:1)提出级联代理攻击的通用框架,可适用于黑盒和白盒场景;2)设计高效的训练策略,减少对目标模型查询次数;3)通过大量实验验证了方法的有效性和鲁棒性。该研究揭示了机器学习模型在隐私保护方面的潜在风险,提醒开发者在部署模型时应考虑更严格的防御措施,如差分隐私训练或输出扰动。

💡 推荐理由: 该研究提出了一种更高效的成员推理攻击方法,能在黑盒场景下达到较高准确率,表明现有模型在隐私保护上仍存在薄弱环节,对数据合规和隐私安全有警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xinyu Tang 0003, Saeed Mahloujifar, Liwei Song, Virat Shejwalkar, Milad Nasr, Amir Houmansadr, Prateek Mittal

本文针对机器学习模型中的成员推断攻击(Membership Inference Attacks)提出一种名为SELENA的隐私保护训练框架。成员推断攻击旨在通过模型对成员与非成员输入的差异行为推断某样本是否属于训练集,是衡量模型隐私泄露的关键指标。现有防御方法如差分隐私虽能提供可证隐私保障,但会显著降低模型效用。本文的目标是在保持模型效用(utility)的同时提高成员隐私,即实现经验性隐私保障。SELENA框架包含两大核心组件:第一,Split-AI集成架构,它将训练数据随机划分为多个子集,并在每个子集上独立训练模型;在推理阶段,对于每个输入样本,仅聚合那些训练数据中不含该样本的模型输出,从而阻断攻击者利用模型行为差异。作者证明Split-AI能防御一大类成员推断攻击,但仍可能受到自适应攻击。因此,第二组件采用自蒸馏(Self-Distillation)方法,通过Split-AI集成对训练数据集进行自蒸馏,无需外部公共数据集,进一步增强对更强攻击的鲁棒性。在多个基准数据集上的实验表明,SELENA在成员隐私与效用之间实现了优于现有技术的权衡。本文适合机器学习安全研究人员、隐私保护从业者以及关注模型隐私泄露的工程师阅读。

💡 推荐理由: 成员推断攻击是评估机器学习模型隐私风险的核心方法,SELENA在保持模型高性能的同时显著提升隐私,为实际部署提供实用方案。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)