#information-leakage

共收录 5 条相关安全情报。

← 返回所有主题
👥 作者: Richard A. Dubniczky, Bertalan Borsos, Tamás Bisztray, Norbert Tihanyi

该论文提出并实施了一项大规模系统性研究,旨在利用大语言模型(LLM)检测和分析学术预印本档案中的信息泄露问题。研究背景在于,科研人员在提交预印本(如arXiv、bioRxiv等)时,往往会在匿名化处理后的手稿中残留可识别身份的信息(例如姓名、所属机构、电子邮件地址、基金项目编号或致谢措辞),这些残留信息可能泄露作者身份,破坏双盲评审制度,甚至引发提前披露敏感研究内容的安全风险。传统正则表达式或规则方法难以识别语义层面的间接指认,而LLM具备语义理解和上下文推理能力,能够有效发现复杂的泄露线索。论文核心方法为:收集大规模预印本语料,使用多个LLM(如GPT系列)设计提示词,让模型判断每篇论文是否存在潜在的身份泄露,并输出泄露类型和证据片段;同时设计了一套自动验证流程,通过交叉比对公开元数据来确认泄露的真实性。实验结果表明,该方法能够检测出大量传统方法遗漏的泄露情况,量化了不同学科领域、不同时间段的泄露分布,并揭示了作者匿名化习惯中普遍存在的松懈现象。该研究的主要贡献包括:第一,首次使用LLM对预印本档案进行大规模信息泄露审计;第二,构建了可复现的检测流程和评估基准;第三,提供了针对作者、期刊和档案平台的可操作建议,以降低匿名化失败导致的隐私与学术不端风险。适合学术安全研究者、预印本平台管理人员、期刊编辑以及关注匿名化和隐私保护的安全从业者阅读。

💡 推荐理由: 预印本匿名化失败会导致作者身份泄露,影响学术评审公正性,并可能造成敏感研究提前暴露。本文提出的LLM检测方法为蓝队自动化审计内部文档/匿名数据提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Peichun Hua, Haoxuan Xu, Mengyuan Li

该论文提出了“行为技能重建”(Behavioral Skill Reconstruction, BSR)问题,聚焦于闭源 LLM Agent 技能(skill)的功能泄露风险。此前研究主要关注提示注入攻击,试图直接披露技能中隐藏的指令、脚本、常量或数据;相应的防御也集中于防止此类文件或内容的直接泄露。然而,作者指出,即使阻止了文件泄露,用户仍可能通过正常使用技能的行为观察来还原其功能,即“文件保密并不等于功能保密”。为此,论文提出一种黑盒攻击方法 SkillClone,其核心思路是:首先根据技能公开广告(如描述、示例)形成接口假设,然后向目标技能发送结构化的良性探测请求,收集合法的输入-输出对,再据此合成一个可执行的复刻版本,最后通过差分验证(differential validation)反复迭代修复该复刻版本,使其在更多测试输入上逼近原技能的行为。作者在 30 个覆盖规则、表格、流程和算法类技能上进行了评估,结果显示 SkillClone 对多个目标在留出测试输入上实现了完全或部分的功能恢复;迭代查询可以弥补单轮重建中的遗漏。实验还表明,仅依赖“防止内容泄露”的现有防御对这类攻击的覆盖有限,而更简略的技能描述也无法有效阻止行为层面的泄露。论文的核心贡献在于揭示了一种新型攻击面:攻击者仅通过合法交互即可克隆隐藏技能的功能,从而绕过传统披露型防护。该研究面向 LLM Agent 安全、AI 系统隐私保护、以及 AI 服务提供者,提醒防御方必须将“行为侧信道”纳入威胁模型,并设计限制累积信息泄露的机制。

💡 推荐理由: 该研究揭示了 LLM Agent 技能防护的新盲区:即使隐藏了底层实现,攻击者仍可通过正常的黑盒交互重建功能。这对依赖‘文件保密’的 AI 服务提供商构成实际威胁,也影响 Agent 生态中知识产权与敏感逻辑的保护设计。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alyssa Milburn, Erik van der Kouwe, Cristiano Giuffrida

本文针对信息泄露漏洞(如架构级或推测执行中的越界/未初始化读取)提出了一种基于类型的数据隔离(TDI)方案。现有基于数据隔离的保密性解决方案通过静态点对点分析为内存对象着色(如敏感与非敏感),并对加载操作进行插桩以在运行时强制颜色匹配。然而,保守的点对点分析会导致过度近似,损害安全性或进一步降低性能。TDI将不同颜色的内存对象隔离到独立的内存区域,并通过高效的编译器插桩将加载操作约束至目标颜色区域,从而将插桩从加载操作转移到指针算术操作。这种基于区域的设计支持积极的推测感知性能优化,并消除了对点对点分析的需求。TDI的颜色管理灵活:既可采用类似先前工作的少色方案(如2种颜色),也可采用基于基本类型分析的多色方案(每种对象类型一种颜色),后者提供细粒度数据隔离,无需注释,并强制等效于理想(上下文敏感)类型点对点分析的强颜色匹配不变式。实验结果表明,TDI在SPEC CPU2006和nginx上的平均性能开销低于10%,能够高效支持强安全不变式。

💡 推荐理由: 信息泄露漏洞是持续存在的严重威胁,现有缓解方案要么性能开销高,要么安全性不足。TDI提供了一种低开销、高安全性的新路径,尤其适合需要强隔离的场景,对编译器安全设计和系统安全加固具有重要参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 3.5
Conf: 50%
👥 作者: Mateo Espinosa Zarlenga

该论文重新审视了基于概念模型(Concept-based Models, CMs)中信息泄漏的传统观点。CMs是一类深度神经网络,其预测基于与人类可理解概念(如“圆形”、“条纹”等)对齐的表示。过往研究通常认为,CMs会学习到泄漏概念无关信息的表示,这种泄漏被视为不可取的,应予以消除,因为它会导致模型不可解释。然而,本文作者指出,这一传统观点在两方面存在缺陷:首先,泄漏导致模型不可解释的证据往往不具决定性;其次,在现实世界中常见概念不完备(concept incompleteness)的约束下,完全消除泄漏会导致模型不实用。作者论证,在概念不完备成为常态的实际场景中,一定程度的泄漏对于构建准确且可干预(intervenable)的CMs是必要的。据此,他们提出了“良性泄漏”(benign leakage)的概念,并通过重新构建典型的CM训练目标,使得模型能够主动鼓励并利用这种良性泄漏,而不会牺牲预测准确性或干预能力。论文通过理论分析和实验验证,展示了所提方法在多个基准上的有效性。该研究为CMs的设计提供了新视角,有助于在保持可解释性的同时提升模型实用性。适合机器学习、可解释AI领域的研究者和从业者阅读。

💡 推荐理由: 颠覆了概念模型必须消除信息泄漏的固有认知,提出了良性泄漏的新范式,对设计既准确又可干预的现实CMs具有指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ari Holtzman, Peter West

该论文研究了前沿语言模型在写作任务中是否能够保守秘密。作者给每个模型一个秘密词,要求模型在写故事时不要泄露该词,然后使用另一个模型通过二分类测试来判断故事是否包含该秘密。尽管秘密词从未以字面形式出现在输出中,但所有五个测试的前沿模型都以显著高于随机水平的概率(最高达79%)通过主题、意象和设定等间接方式泄露了秘密。当模型被告知主动隐藏秘密时,它们会刻意避开秘密词,但这种回避行为本身也是可检测的。泄露模式具有跨模型可读性,在两个模型族内随模型规模急剧增加,但对于笑话等短文本则完全消失。给模型一个干扰概念让其“专注”可以部分地将泄露从真实秘密转移到干扰概念。研究表明,注意力机制似乎打开了一个信息通道,前沿LLM即使被指示也无法关闭。该工作揭示了LLM在需要信息隔离的场景中存在隐秘的信息泄露风险。

💡 推荐理由: 揭示了LLM在系统提示、思维链推理、敏感数据处理等需要信息隔离的场景中,会无意识泄露机密信息,且无法通过简单指令消除,对安全部署构成挑战。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)