#prompt-sanitization

共收录 2 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Zhenhua Liu, Zhanxu Xie, Junjie Yu, Tong Zhu, Lijun Li, Wenliang Chen

该论文关注大语言模型进入日常任务后产生的隐私与效用矛盾:用户为了让模型完成复杂任务,必须提供上下文丰富的指令,其中往往夹带姓名、地址、账号、病史等敏感信息。目前主流的隐私保护做法是在把提示词发给模型之前套用一套与上下文无关的静态规则(例如统一对实体做删除或掩码),虽然降低了泄漏风险,却常常把任务真正依赖的关键信息一起抹掉,导致下游回答质量严重下降。作者指出,真正的空白在于:净化操作究竟通过什么机制影响下游性能,此前缺乏系统性的解释,因此也就无法设计出有原则的折中方案。 为回答这一问题,论文做了系统性的实证分析,把隐私-效用的权衡拆解成三个相互衔接的机制。第一是“上下文相关效用”,它回答“何时需要净化”:同一段数据在某个用户意图下是不可或缺的关键约束,在另一个意图下则只是可丢弃的噪声,因此净化时机必须由意图决定,而不能一刀切。第二是“策略性适配”,它回答“如何净化”:究竟选择直接删除还是替换为占位内容,取决于下游任务更依赖事实完整性还是结构连贯性——偏事实的任务倾向于替换以保留结构,偏结构的任务则可以删除。第三是“组合交互”,它把保护范围从单一属性扩展到属性之间的关系:多个属性之间存在协同依赖或对抗冗余,构成一张语义网络,孤立地处理单个字段既可能保护不足,也可能过度破坏语义。 基于上述洞察,作者提出一个意图驱动的本地保护框架:先蒸馏出一个轻量模型 Veilmind-4B,再由它驱动“抽取—净化—恢复”的动态流水线,在本地完成敏感信息识别、按意图与任务类型选择净化策略,并在响应返回后做必要的还原。实验表明,该方法能在达到较低泄漏水平的同时,保留显著高于既有隐私导向基线的回答效用,把隐私-效用权衡推向帕累托前沿。适合隐私保护、LLM 应用架构、可信 AI 与合规治理方向的研究者和工程师阅读。

💡 推荐理由: 提示词脱敏是企业落地 LLM 的高频痛点:静态规则要么漏保护、要么把任务上下文一起删掉。该论文把“何时净化、如何净化、属性如何联动”讲清楚,并给出可本地部署的轻量流水线思路,对设计兼顾合规与可用的提示词防护层有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Chen Gu, Hui Wan, Donghui Hu, Hui Wang, Zhuoer Gu

本论文针对大型语言模型(LLM)服务中的隐私保护问题提出了一种新的提示清洗方法PromptGraph。LLM推理过程中,用户的敏感信息不仅可能通过显式标识符(如姓名、电话号码)泄露,还可能通过看似无害的文本片段之间的上下文关联被推断。现有的提示清洗方法通常为每个片段单独分配隐私或效用信号,忽略了片段之间的成对关系。PromptGraph将每个提示表示为属性图,其中节点承载片段的隐私分数,边编码维持效用所需的上下文依赖关系。清洗目标是在最大化隐私增益的同时,惩罚上下文依赖关系的损失,从而在隐藏上下文证据时显式平衡隐私与效用。受保护的片段会被本地清洗,返回的占位符只有在通过局部一致性检查后才被恢复。实验结果表明,PromptGraph在隐私与效用之间取得了比现有的提示隐私基线更优的平衡。该方法为LLM隐私保护提供了新思路,特别适合需要同时保护隐私和保持推理质量的场景,如医疗、金融等敏感领域。

💡 推荐理由: 该研究提出了一种图引导的提示清洗方法,能够显式建模片段间的上下文依赖关系,在保护隐私的同时保持LLM推理的效用,为实际部署隐私保护LLM服务提供了可行方案。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)