#contrastive-learning

共收录 11 条相关安全情报。

← 返回所有主题
👥 作者: Manuel Röder, Bibin Babu, Frank-Michael Schleif

针对传统网络攻击活动检测依赖跨组织共享敏感遥测与威胁情报、带来隐私与合规障碍的问题,本文提出一种基于联邦学习的模块化框架 FedIoC,用于在不直接传输 IoC(威胁指标)的情况下恢复跨组织的协同攻击活动模式。其核心思路是:各参与客户端在本地将已识别的结构化 IoC(如恶意 IP、域名等)与网络流进行匹配,并通过监督对比学习训练本地编码器——在每个训练批次中,凡是命中已知指标模式的流被视为正样本,未命中的为负样本;训练目标将同类嵌入拉近、异类嵌入推开,从而使得与攻击活动相关的特征模式自然体现在模型更新的梯度方向中。由于共享同一攻击活动指标的客户端会演化出方向对齐的梯度分量,联邦服务器无需收集原始 IoC,仅依据各客户端上传梯度之间的余弦相似度进行聚类,即可发现属于同一全球攻击活动的客户端群组,进而重构活动图景。作者在将两个公开威胁检测数据集分布到多个联邦客户端的环境中进行实验:每个客户端仅能观测到每个活动的一小部分流量片段,并持有彼此不重叠的本地 IoC 集合。实验结果表明,在此极端数据碎片化情景下,仅凭梯度几何特征即可有效恢复跨组织活动队列。该工作还将非独立同分布(non-IID)的梯度结构确认为影响恢复效果的主要驱动因素,并顺带提出一个开放问题:设计何种编码器能对这种梯度结构进行进一步改善。总体而言,FedIoC 为隐私保护型跨机构协同威胁检测提供了新的技术路线,即利用联邦梯度本身作为隐式威胁情报信道。

💡 推荐理由: 该工作将联邦学习与对比学习相结合,使安全团队无需共享原始 IoC 即可在梯度域识别跨组织攻击活动,为多机构协作威胁检测提供了隐私友好的新思路。对蓝队而言,是理解联邦威胁检测范式及其潜在价值的重要参考。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mengyuan Sun 0001, Yu Li 0006, Yunjie Ge, Yuchen Liu, Bo Du 0001, Qian Wang 0002

多模态对比学习模型(如CLIP)凭借出色的视觉-语言对齐能力,已广泛用作大规模多模态系统的核心基础组件。然而,这类模型极易遭受后门攻击:攻击者可向训练数据注入隐蔽触发器,使模型在推理时遇到特定图案便产生恶意输出,且后门效应会沿下游任务传播,构成重大安全威胁。针对现有防御方法的不足——通常需要已知攻击目标或访问中毒数据集、依赖大量干净数据,实际部署受到严格限制——本文提出 InverTune,一个在最小攻击者假设下工作的新型后门防御框架。它既不预先知道攻击目标,也无需使用训练阶段的中毒数据集。InverTune 的核心流程包含三个关键组件:(1) 通过对抗模拟暴露攻击签名,利用模型响应模式概率性地识别目标标签;(2) 基于该标签推断,采用梯度反演技术分析神经元激活模式,重建潜在触发器;(3) 设计聚类引导的微调策略,仅借助少量任意干净数据即可擦除后门功能,同时保持原始模型的任务性能。实验部分针对多种最先进的攻击方法进行验证,结果显示 InverTune 平均将攻击成功率(ASR)降低 97.87%,而干净准确率(CA)仅下降 3.07%。该工作为多模态安全防护开辟了新范式,证明了在不牺牲模型能力的前提下可有效抵御后门注入,为基础模型的安全部署提供了可行路径。适合关注多模态模型安全、后门防御及基础设放稳健性的安全研究员和算法工程师阅读。

💡 推荐理由: 对使用CLIP等多模态基础模型的企业和安全团队而言,InverTune提供了一种无需攻击先验或大量干净数据的后门防御方案,解决了现有方法实用性差的痛点,有助于在真实部署中对抗后门注入,降低模型供应链与部署风险。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jiechao Gao, Yuandong Pan, Jie Wang, Michael Lepech, Bradford Campbell

在智能家居、可穿戴设备等传感器密集型环境中,系统通过异构的多传感器数据流推断用户正在使用的应用,从而提供智能服务。然而,并非所有应用都应该被识别——用户希望某些活动保持私密。现有隐私保护方法(如差分隐私、基于规则的过滤)仅针对单一数据流,无法应对攻击者利用跨传感器关联推断出用户隐私的风险。为此,论文提出一种名为 PrivateHub 的隐私保护框架,采用对比学习与扩散模型的结合,生成合成的多传感器数据流。该方法生成的数据可以保持非私密应用的可检测性,同时有效掩盖私密应用的存在。PrivateHub 包含两个训练阶段:应用条件预训练(ACP)和应用感知微调(AAF)。ACP 阶段利用应用嵌入对多传感器数据进行条件生成建模,使模型理解应用类别与传感器模式的关系;AAF 阶段通过对比学习将私密和非私密数据在表征空间上分离,并优化生成器使得私密应用在合成数据中对应的特征与真实数据混淆,从而显著降低攻击者分类器对私密应用识别的准确率。论文还定义了多传感器共享场景下的威胁模型,假设攻击者直接访问用户共享的原始传感器数据流,并尝试推断用户正在使用的应用。在三个真实多传感器数据集上的实验表明,PrivateHub 能将私密应用的识别准确率降低 40% 到 50%,同时非私密应用的分类性能几乎不受影响。即使在攻击者利用合成数据对自身模型进行再训练的情况下,该方法的隐私保护效果依然稳定,说明其并非依赖简单的噪声扰动,而是产生了具有泛化性的特征混淆。本文的主要贡献包括:提出了首个面向跨传感器推断风险的扩散生成式隐私保护方案;设计了对比学习与条件扩散模型的结合机制;给出了完整的威胁模型和评估协议。该研究适合可信机器学习、隐私保护、物联网数据共享等方向的学者及从业者阅读。

💡 推荐理由: 多传感器环境的数据共享存在跨传感器联合推断的私密活动泄露风险,传统脱敏手段往往无效。PrivateHub 从数据源头生成合成样本,为隐私保护提供新思路,可启发蓝队设计更健壮的传感器数据发布前处理机制。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Depeng Chen, Xiao Liu, Jie Cui 0004, Hong Zhong 0001

本文提出了一种基于对比学习的成员推断攻击方法 CLMIA。成员推断攻击旨在判断某个数据样本是否被用于训练目标机器学习模型,其原理是模型在有限数据集上多次训练后容易记忆训练样本。然而,现实场景中攻击者难以获得足够多带有准确成员身份标签的样本,且大部分样本实际上是非成员,导致传统攻击方法效果受限。为解决该问题,作者利用无监督对比学习训练攻击模型,仅需少量已知成员状态的样本对攻击模型进行微调即可实现有效攻击。实验采用 ROC 曲线评估,结果表明 CLMIA 在低误报率(FPR)下具有更高的真正例率(TPR),优于其他已有方案。该方法揭示了机器学习模型在数据记忆方面的隐私风险,对模型训练和部署中的隐私保护提出了新的挑战。适合关注模型隐私安全的研究人员和防御者阅读。

💡 推荐理由: 该研究展示了一种更实用的成员推断攻击方法,帮助蓝队理解模型训练数据的隐私泄露风险,为评估和设计防御措施提供参考。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiming Chen, Kemou Li, Haiwei Wu, Jiantao Zhou

本文针对多模态对比学习(MCL)中的后门攻击检测问题展开研究。MCL 模型(如 CLIP)被广泛用于预训练,但其容易受到后门攻击的影响,现有基于检测的防御手段主要依赖 CLIPScore 指标,假设中毒图像-文本对具有较低的语义相似度。然而,作者指出现有方法存在两个关键缺陷:一是良性对与中毒对的 CLIPScore 分布存在显著重叠,使得该指标难以可靠区分;二是固定阈值检测无法对重叠区域中的模糊样本提供统计保证。为克服上述局限,本文引入保形预测(Conformal Prediction, CP)这一统计框架,利用非一致性分数(Nonconformity Scores, NCSs)量化不确定性,从而为检测中毒图像-文本对建立具有可证明置信界的方法。在此基础上,作者提出 CASCADE——一种新型的两阶段粗到细的保形后门检测框架。在粗粒度阶段,通过跨模态一致性筛选出高置信度的良性对和中毒对;在细粒度阶段,利用高置信度中毒对构建参考集,并针对未识别子集中的每个样本计算基于文本空间相似度的实例级 NCS,以度量其与中毒分布的符合程度,进而精确识别潜在中毒对。在 CC3M 大规模数据集上的大量实验表明,CASCADE 在多种攻击场景下平均可实现 100% 真阳性率(TPR)时仅 5.79% 的假阳性率(FPR),平均 AUROC 达到 0.9867,并且对自适应攻击仍保持有效性。该工作为多模态对比学习模型提供了一种兼具统计保证与高检测精度的后门防御新思路。

💡 推荐理由: 多模态预训练模型已被广泛采用,后门攻击威胁真实存在。现有 CLIPScore 检测法有统计缺陷,CASCADE 通过保形预测提供可证明的置信界,提升了检测可靠性,值得安全从业者关注。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhen Li, Gang Cao, Tian Zhang, Lifang Yu, Shaowei Weng

本文针对大规模生成模型快速发展导致的高度逼真AI生成图像泛滥问题,提出了一种新的通用合成图像检测框架RNSIDNet。现有取证网络通常依赖单一域表示和传统二分类优化,导致跨模型泛化能力差且对真实世界退化(如JPEG压缩、缩放等)鲁棒性不足。为了克服这些局限,作者设计了双分支架构:一方面,使用经注意力优化的CLIP骨干网络提取全局RGB语义特征;另一方面,利用Bayar卷积捕获高频噪声伪影,并通过特征级线性调制(FiLM)模块使RGB语义动态调制噪声特征。为了进一步增强表示判别性,提出了困难样本感知对比学习(HSCL)策略,通过显式惩罚难分类样本来重塑潜在特征空间,最大化真实图像与合成图像之间的判别边际。在8个公开基准数据集上的大量实验表明,该方法在泛化能力、鲁棒性和计算效率方面均达到最先进水平。论文提供了代码和数据集链接。该研究对数字图像取证、社交媒体虚假内容治理等领域具有重要参考价值。

💡 推荐理由: 生成的图像泛滥对社会信任构成严重威胁;本文提出一种高泛化性、鲁棒的检测方法,可提升蓝队应对AI生成内容滥用(如虚假新闻、身份伪造)的检测能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.5
Conf: 50%
👥 作者: Yizheng Chen 0001, Zhoujie Ding, David A. Wagner 0001

该论文聚焦于Android恶意软件检测中的概念漂移(concept drift)问题。现有机器学习分类器在训练时能达到很高的准确率(例如F1分数0.99),但部署后随着时间推移,由于恶意软件和良性应用的持续演化,分类器性能急剧下降——在仅6个月后,F1分数就降至0.76。为应对这一挑战,论文提出了一种结合对比学习(contrastive learning)与主动学习(active learning)的持续学习框架。核心思想是利用基于相似性的不确定性度量来对抗概念漂移,因为传统的不确定性采样在面对分布偏移时不够鲁棒。具体而言,作者提出了一种新的层次化对比学习方案(hierarchical contrastive learning),通过对样本进行多级特征对比,学习到更稳定、更具泛化能力的表示。同时,设计了一种基于相似性不确定性的样本选择技术,优先挑选那些模型预测最不确定且与已有样本特征差异最大的新样本,交予分析师标注后用于增量训练。实验基于长达七年的真实数据集进行评估,结果表明该方法在多个指标上显著优于先前主动学习基线:假负率从14%降至9%,假正率从0.86%降至0.48%,并且在整个七年时间跨度内保持了更加一致且稳定的性能。论文主要贡献在于:1)揭示了Android恶意软件检测中概念漂移的严重性;2)提出将对比学习无缝集成到主动学习流程中,以提升对概念漂移的鲁棒性;3)通过大量实验验证了该方法在长期部署场景下的有效性。适合从事移动安全、机器学习运维(MLOps)以及对抗性机器学习研究的读者阅读。

💡 推荐理由: Android恶意软件检测是移动安全的核心任务。该工作揭示了经典分类器因概念漂移快速失效的严重性,并提出结合对比学习的主动学习方案,可显著延长模型有效寿命,减少人工重新标注成本,对实际安全运营具有直接指导价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Minseok Choi, Seungbin Yang, Dongjin Kim, Subin Kim, Jungmin Son, Yunseung Lee, Jaegul Choo, Youngjun Kwak

本文提出了一种名为Membrane的自我演化防护栏,用于增强大型语言模型(LLM)智能体防御不断演化的越狱攻击。当前的安全对齐方法难以适应新型攻击,而基于微调的安全分类器无法实时更新,基于记忆的防护栏又容易对良性查询过度拒绝。Membrane通过构建对比安全记忆(CSM)来解决该问题:每个记忆单元记录阻止有害查询的条件,同时保留允许与之表面相似的良性查询的条件,从而形成对比对。无需重新训练模型,Membrane在每次有害交互后,将该交互及其良性对照物蒸馏为一个对比单元,并按攻击策略索引,使得同一单元能泛化至该策略下不同主题的变体。推理时,检索到的单元作为安全决策的上下文依据。在模型级安全基准HarmBench和智能体级安全基准AgentHarm上,Membrane在所有六种越狱攻击上取得最高F1分数。尤为重要的是,在AgentHarm上良性拒绝率仅为7-14%,远低于先前方法的28-85%。此外,记忆单元在跨攻击迁移下仍保持87-88%的F1,且对记忆投毒攻击具有稳定性。该方法适合LLM安全研究者、智能体系统开发者及蓝队防御工程师关注。

💡 推荐理由: Membrane提出了一种无需重训练的自适应防护方案,有效平衡了有害拦截与良性放行,特别适合需要动态防御的LLM智能体场景。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jiangnan Zhu, Yuntao Wang, Shengli Pan, Yujie Gu

该论文提出了一种名为 Vol-Mark 的新型可逆零水印方法,用于保护远程医疗中 3D 医学体积数据的完整性和所有权。针对医学体积数据在网络共享中面临的数据篡改和未授权复制等安全风险,Vol-Mark 设计了两个核心组件:一是利用对比学习构建的体积特征提取器,能够高效提取具有判别性和稳定性的体积特征,增强对 3D 攻击的鲁棒性;二是引入了立方体差异扩展(c-DE)技术,基于三维整数小波变换将水印比特嵌入到低频系数的邻域体素中,通过扩展立方体内的体素差异来创建嵌入空间,并在提取时采用多数投票机制提高可靠性。该嵌入过程失真低且支持无损移除,从而保持医学体积数据的完整性和诊断精度。Vol-Mark 首先进行完整性验证,再通过假设检验进行所有权验证,以增强在数据篡改或水印移除攻击下的可靠性。实验结果表明,Vol-Mark 在常规、几何和混合攻击下均表现出优越的鲁棒性,在多数攻击场景下准确率(ACC)保持在 0.90 以上,显著优于现有方法。

💡 推荐理由: 医学体积数据是远程医疗的关键资产,其安全共享面临篡改和盗版风险。Vol-Mark 提供了一种可逆零水印方案,既能验证完整性又能在不损伤诊断精度的前提下确权,对保护患者数据和医疗知识产权具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao

该论文针对大语言模型(LLM)面临的分解式越狱攻击提出了一种新型防御框架。分解式越狱攻击通过将恶意目标拆分为一系列看似无害的查询,使攻击者能够绕过安全防护,累积重构出被禁止的内容。在实际部署中,LLM面对连续、不可追溯的匿名请求流,其中混杂着隐蔽分布的对抗性查询,现有防御策略在无可靠用户元数据时无法跟踪全局历史上下文,且基于生成模型的实时监控计算开销过大。为此,作者提出TwinGate,一种状态ful双编码器防御框架。TwinGate采用非对称对比学习(ACL),将语义不同但意图匹配的恶意片段在共享潜在空间中聚类,同时利用并行的冻结编码器抑制良性主题重叠导致的误报。每个请求仅需一次轻量级前向传播,可在目标模型填充阶段并行执行,延迟开销可忽略。为评估方法并推动未来研究,作者构建了包含超过362万条指令、覆盖8600种恶意意图的综合数据集。在严格因果协议下的大规模语料评估中,TwinGate实现了高恶意意图召回率和极低的误报率,且对自适应攻击具有强鲁棒性。相较于有状态和无状态基线,该方法在吞吐量和延迟方面均显著优于同类方案。该研究适合LLM安全研究人员、AI红队成员以及致力于构建实用防御机制的工程师阅读。

💡 推荐理由: 分解式越狱攻击是当前LLM安全中的隐蔽威胁,TwinGate提出了一种高效的状态ful防御方案,在不依赖用户身份的前提下实现高精度检测,对实际部署场景具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Kecen Li, Chen Gong, Zinan Lin, Tianhao Wang, Xiaokui Xiao

该论文聚焦于差分隐私(DP)对比学习中的隐私-效用权衡问题。现有的DP对比学习方法因标准对比目标中样本间固有的强依赖性而遭受严重的效用退化:每个样本的梯度依赖于批次中的所有其他样本,这放大了DP噪声的影响。作者指出,有效的DP对比学习需要显式地减少这种内在的样本间依赖。为此,他们提出了DP-GCL,一个原则性的DP对比学习框架,通过限制组级贡献来结构化地限制梯度依赖。DP-GCL将每个批次划分为小的、不相交的组,并将可用的负样本限制在组内,从而局部化梯度影响并降低敏感度。为了弥补由此造成的负样本多样性损失,进一步引入了组内增强,在不增加隐私成本的情况下生成额外的负视图。在八个数据集上的大量实验表明,在实际隐私预算下,DP-GCL在单模态和多模态对比学习中均持续提升了现有技术水平:与现有DP对比方法相比,图像分类准确率提升5.6%,图像-文本检索准确率提升20.1%。该工作为部署或共享在敏感用户数据上训练的嵌入模型提供了更实用的隐私保护方案。

💡 推荐理由: 该研究解决了DP对比学习中严重的效用退化问题,为安全工程师在保护用户隐私的同时保持模型可用性提供了新思路,尤其适用于需要发布或共享嵌入向量的场景。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)