#extraction

共收录 3 条相关安全情报。

← 返回所有主题
👥 作者: Xujun Che, Depeng Xu, Shuhan Yuan

本文研究大语言模型(LLM)中记忆与提取现象的度量问题。长期以来,模型记忆的定义繁多且关系不明,差分隐私(DP)常被当作同时控制所有记忆形式的统一代理。作者针对实际应用中最重要的两类定义——反事实记忆(counterfactual memorization)与自适应提取(adaptive extraction)——给出了精确的 DP 常数,并证明这两者并不能互相约束。具体地,在 f-DP 框架下,任何带有列表预算 m 的自适应提取协议的成功概率至多为 1-f(κ)(其中 κ 为无遗忘基线),该界在一组稠密基线上是紧的;这意味着 DP 对提取的控制本质上取决于秘密先验可猜测的程度。进一步地,最小熵提供了一个分布无关的保证:在纯 ε-DP 下,只要 H_∞ ≥ ε log₂ e + log₂(m/τ),提取风险就低于 τ≤1/2,且在均匀先验上该界精确。在记忆侧,f-DP 将任何有界得分的反事实记忆限制在优势泛函 η(f) 内,纯 DP 下等于 tanh(ε/2);对于 k≥2 份重复副本,朴素的 ε↦kε 界不可达,精确常数是一个由几何噪声计数达到的闭式阶梯函数。该上限在实际使用的局部得分类中达到,并在此处两种度量发生分离:一种机制被记忆却不可提取,另一种完全可提取但对所有基于损失的得分不可见。由此在基于损失的审计与遗忘验证中产生双侧盲点,该盲点在十亿参数模型上依然存在:一个保留触发器的模型发布可以通过单个提示逐字恢复,而实践者部署的审计却判定其完全干净。论文的贡献在于精确刻画记忆与提取的差分隐私边界,揭示了两者的非等价性以及现有审计方法的固有缺陷,为 LLM 隐私评估提供了新的理论基础。

💡 推荐理由: 该研究揭示基于损失的记忆审计和遗忘验证存在结构性盲点,可能导致严重的隐私泄露在现有检测手段下被忽视。它为安全团队重新评估 LLM 隐私保护提供了关键理论依据,提醒审计方法需要多元信号而非仅依赖损失函数。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yiting Qu, Ziqing Yang, Chi Cui, Ye Leng, Junjie Chu, Yang Zhang

该论文研究了一个此前被忽视的安全问题:能否通过黑盒API交互,从前沿专有大型推理模型(LRM)中近乎逐字地提取隐藏的思维链(Chain-of-Thought, CoT)。隐藏CoT被视为模型的核心资产,尤其是商业模型内部的推理过程,过去普遍认为直接提取不可行。作者发现了一个工具调用之间的‘推理重放面’(reasoning replay surface),并据此设计了EchoCoT——一种多阶段攻击方法。该方法利用API返回的保真度信号(例如生成token的logits或长度信息)作为反馈,迭代式地调整注入轨迹,从而逐步逼近并还原隐藏的CoT。为了提升通用性,作者还构建了一个基于LLM的自动优化框架,能够在不同数据集上自动搜索有效的通用注入轨迹。实验在三个开源LRM和五个前沿专有LRM上进行。在开源模型上,EchoCoT实现了最高66.4%的近乎逐字提取成功率,且提取出的轨迹长度与目标相差不超过10%,至少90%的token与目标CoT完全匹配。同一注入轨迹还能泛化到未见数据集,在相同标准下达到80%的成功率。对于专有模型,提取出的CoT与提供商报告的推理长度及现有CoT摘要高度吻合;尤其对Gemini-2.5,成功提取了目标为32,948 token的CoT中的33,463个token(长度超过目标,说明存在过度生成)。这些结果证明隐藏CoT提取是一个实际安全风险,凸显了保护模型思维链资产的紧迫性。适合关注LLM安全、模型资产保护和AI对抗性攻击的研究者与安全工程师阅读。

💡 推荐理由: 首次系统性地证明黑盒专有LRM的隐藏思维链可被近乎逐字提取,直接威胁模型核心知识产权与推理隐私,对依赖CoT商业价值的厂商构成紧迫安全警示。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Akshay Sasi

本论文针对大语言模型(LLM)量化是否能够降低隐私风险的问题展开研究。现有相关研究几乎全部使用成员推断(membership inference)来衡量隐私,但作者认为这并非大多数人所关心的实际风险:人们真正担心的是模型逐字复现训练数据。为此,本文直接度量了逐字提取(verbatim extraction)这一风险。实验使用 Pythia 模型以及每个模型已知被记忆的公共序列,在从全精度到四比特的五个精度级别、三种模型规模下,追踪逐字提取的比例,同时测量困惑度以评估通用能力。主要发现有两方面:第一,量化是一种选择性遗忘器——在每种精度和模型规模下,逐字记忆的下降速度都快于能力下降,并且该结论在两种不相关的量化算法和两个评估语料库下均成立;第二,这种选择性不足以使量化成为隐私防御手段,这与先前成员推断研究结果的乐观解读相矛盾。在最大规模的模型中,四比特量化仍能复现大部分记忆序列,而能力仅下降几个百分点,且量化后存活的记忆数据比例随模型规模增大而增加。作者得出结论:压缩不应被视为移除记忆训练数据的方法,提取(extraction)而非成员推断才是实践者应关注的指标。所有代码、采样评估数据和逐配置结果均已公开。

💡 推荐理由: 该研究打破了“量化可缓解隐私风险”的乐观认知,指出量化在较大模型中会保留大部分可提取数据,对依赖量化作为隐私保护手段的 LLM 部署方具有警示意义。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)