#in-context-learning

共收录 4 条相关安全情报。

← 返回所有主题
👥 作者: Tejasvi C. Addagada

该研究旨在验证两种独立 LLM 安全削弱因素是否会相互叠加:一是结构化对抗性提示 Jailbreak 类——称为“非自愿上下文学习”(Involuntary In-Context Learning, IICL),即把有害请求包装成一个由模式而非内容填充的数据标注任务的缺失格;二是非英语语言环境下安全对齐的退化。作者在 Google Gemini 的一个双模型上,基于 HarmBench(30 条通用危害行为)与 FinProof(30 条金融虐待行为)两个基准,分别测试了单次基线提示和四种语言(英、西、印地、阿拉伯)下的 IICL。结果显示,IICL 对跨提供商具有迁移性,并且在金融领域危害更重——HarmBench 攻击成功率由 <=6.7% 升至 80–90%,FinProof 升至 97–100%,远高于原论文在 OpenAI GPT-5.4 上公布的 <=24% 。然而,作者假设的多语言叠加并不成立:强迫 IICL 输出至非英语反而缓解攻击,12 个非英语条件中有 11 个成功率低于英语基线(符号检验 p≈0.003),唯一异常是接近 100% 的天花板平局;在更强模型的金融集中,阿拉伯语从 100% 锐减至 33%。作者将其归因于“相关性诅咒”:结构一旦破解遵守行为,模型在低资源语言中产生内容质量较低的有害文本,导致实质评分判断部分成功。结果在独立的非 Google 评审器下复现(Cohen's kappa=0.86,377 对配对),且 76.6% 的非英语响应经语言核定。因此,Jailbreak 漏洞不可简单加总,主导性剩余风险是英语结构化攻击,尤其对金融虐待最烈,而非多语言利用。该论文适合 LLM 安全研究人员和开发大模型应用的红队团队阅读。

💡 推荐理由: 本论文揭示了结构性 jailbreak(IICL)可以跨模型提供商转移,且在金融域的攻击成功率异常高(FinProof 上达 97-100%);同时打破“多语言叠加”假设,提醒蓝队不要把资源过多投入到低风险的多语言对抗,而应优先加固英语结构化提示场景,特别是财务对话应用。

🎯 建议动作: 纳入内部评估

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Daniel Rodriguez-Cardenas, David Nader Palacio, Anna Schmedding, Yiyang Lu, Aadil Mallick, Bill Hudson, Chris Gourley, Michael Roytman, Chris Shenefiel, Evgenia Smirni, Denys Poshyvanyk

本文是一篇来自工业界的案例研究,旨在解决软件漏洞严重性评估的可扩展性与隐私问题。当前安全分析师手动分配CVSS评分的方式难以应对漏洞数量增长,且传统方法常依赖云端LLM服务,存在代码片段泄露的机密性风险。为此,作者提出利用本地可部署的开源LLM,基于漏洞相关的C/C++代码片段,通过上下文学习(in-context learning)直接预测CVSS v3.1分数。研究首先对比了专有工业数据与公开的Big-Vul数据集,发现两者的CVSS分布高度一致,从而验证了将Big-Vul作为工业数据代理来构建基于提示的测试平台的合理性。随后,作者系统变化上下文配置和模型参数,评估了CodeLlama2-7B、CodeLlama2-13B、Mistral-7B、gpt-oss和GPT4o-mini等模型,使用均方误差(MSE)和可行性指标进行衡量。实验结果表明,中等规模的开源代码模型(特别是CodeLlama2-7B)在轻量级输出约束提示的引导下,能够接近最佳云端模型的CVSS回归性能,为工业场景下的严重性分诊提供了一种实用且隐私保护的构建模块。该研究的主要贡献包括:验证了公开数据集作为工业数据代理的可行性,系统比较了多种开源模型在本地部署下的性能,以及展示了上下文学习在漏洞严重性预测中的潜力。适合软件安全工程、漏洞管理平台开发者和关注隐私保护的安全团队阅读。

💡 推荐理由: 该研究为漏洞严重性评估提供了一种不依赖云端API的本地化方案,解决了代码泄露风险与扩展性瓶颈。对于需要处理大量漏洞且对数据隐私有严格要求的蓝队和SOC团队,具有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 11.6
Conf: 50%
👥 作者: Rui Wen 0002, Zheng Li 0023, Michael Backes 0001, Yang Zhang 0016

本文首次提出针对大语言模型(LLM)上下文学习(In-Context Learning, ICL)场景的成员推理攻击(Membership Inference Attack)。ICL作为一种参数高效的适配方法,通过提供少量示例即可让LLM适应新任务,但其隐私风险在现实假设下尚缺乏系统研究。作者设计了四种攻击策略,分别适应不同的受限场景(如仅能访问模型生成的文本、无需概率输出等),并在四个主流LLM上进行了广泛实验。实验结果表明,所提攻击在大多数情况下能准确判断某条数据是否为模型训练成员,例如针对LLaMA模型,攻击准确率优势达到95%,远高于基于概率的现有攻击。此外,作者提出一种混合攻击,综合各策略优势,在多数场景下准确率优势超过95%。最后,作者从数据、指令和输出三个正交维度提出了三种防御方法,综合使用这些防御可以显著降低隐私泄露风险,提供更强的隐私保障。该研究揭示了ICL在隐私保护方面的严重脆弱性,为后续隐私保护研究提供了重要基础。适合关注LLM隐私安全、成员推理攻击防御的学者和安全工程师阅读。

💡 推荐理由: 上下文学习(ICL)是LLM高效适配的主流范式,但本文首次证明仅凭生成文本即可高精度推断成员关系,隐私风险远高于以往认知。蓝队需评估ICL场景下的数据泄露暴露面,并考虑多维防御措施。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.5
Conf: 50%
👥 作者: Francesco Capano, Jonas Böhler

本文研究了大型表格模型(LTM)在上下文学习(ICL)中的参数记忆化现象。尽管大型语言模型(LLM)已被证实会无意中记忆训练数据,但LTM的记忆化动态尚不完全清楚。为此,作者提出了一个名为ICLMEM的探测框架,旨在区分基于上下文的预测与参数记忆化。该框架通过零信息多项选择上下文剥离有效上下文模式,迫使模型依赖其参数记忆。受控微调设置建立了成员资格地面真相,并考虑了常见陷阱(如分布偏移、特征污染、基础率谬误),同时使用预训练基础模型作为参考来校准样本难度。在领先的、基于现实世界训练的LTM上进行受控评估后,在10个任务中的8个检测到中等记忆化信号(AUC最高0.67,1%假阳性率下的真阳性率>0.1)。值得注意的是,低基数任务和二分类任务的记忆化信号最强,但在现实训练条件下大部分消失。研究发现LTM的记忆化信号仅在特定条件下出现(如单任务微调、固定样本许多 epochs、小查询大小)。为保护敏感数据,必须采取适当措施,本文对此进行了讨论。

💡 推荐理由: 表格模型广泛应用于金融、医疗等敏感数据场景,其记忆化特性可能泄露训练数据中的隐私信息。本文首次系统性地探测表格上下文学习中的记忆化,为后续防护措施提供基础。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)