#prompt-stealing

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Yicong Tan, Xinyue Shen 0001, Yun Shen, Michael Backes 0001, Yang Zhang 0016

本文系统研究了针对现实世界(in-the-wild)提示词(Prompt)的“提示词窃取攻击”(Prompt Stealing Attacks)有效性。随着大型语言模型(LLM)的普及,高质量提示词已成为提示词市场中的宝贵商品,但攻击者试图通过观察模型输出反向推断原始提示词,从而威胁提示词市场的知识产权和商业模式。以往研究主要集中在学术数据集上,对真实用户构建的提示词是否同样脆弱缺乏验证。本文首次对真实世界提示词的窃取攻击进行了系统研究。作者首先对比了真实提示词与学术提示词在长度、语义和主题上的差异,发现两者存在显著不同;随后评估了现有提示词窃取方法在真实提示词上的表现,结果显示这些方法效果较差。为提升攻击效能,作者提出基于文本梯度(Text Gradient)的迭代优化方法,通过不断调整提示词以更好地复现目标输出,实验表明该方法显著提升了攻击效果:在提示词恢复方面,METEOR分数从0.207提升至0.253;在输出恢复方面,从0.323提升至0.440。尽管有所改进,但作者指出根本性挑战依然存在,强调仍需进一步研究以提升和评估真实场景下提示词窃取攻击的有效性。本文面向LLM安全、提示词工程和知识产权保护领域的研究人员,提供了对真实提示词攻击难度的首次量化认识。

💡 推荐理由: 提示词作为LLM时代的核心资产,其安全性直接影响商业提示词平台的生态。本研究揭示现有窃取攻击在真实提示词上的低效性,帮助安全从业者客观评估此类威胁的真实风险等级。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Shiqian Zhao, Chong Wang 0013, Yiming Li 0004, Yihao Huang 0001, Wenjie Qu 0001, Siew-Kei Lam, Yi Xie 0011, Kangjie Chen, Jie Zhang, Tianwei Zhang 0004

本文针对文本到图像(T2I)扩散模型(如DALL·E、Midjourney)中的提示词(prompt)窃取攻击展开研究。提示词是用户为生成高质量图像而精心设计的文本描述,具有知识产权价值,但在线展示作品时面临被窃取的风险。现有攻击方法依赖固定修饰词集和模型特定训练,泛化性差且效果有限。为此,作者提出Prometheus——一种无需训练、基于代理模型交互的搜索式提示词窃取攻击方法。核心创新有三:1)引入动态修饰词,利用NLP分析实时生成与目标图像更匹配的修饰词,作为静态修饰词的补充;2)设计上下文匹配算法对修饰词排序,缩小后续搜索空间;3)通过本地代理模型进行贪心搜索,根据反馈逐步优化提示词以提升重建保真度。实验证明,Prometheus在PromptBase、AIFrog等平台上对Midjourney、Leonardo.ai、DALL·E等不同模型均能成功提取提示词,攻击成功率提升25.0%,且对现有防御措施具有抗性,揭示了该攻击的严重性。本文适合AI安全研究者和防御工程师阅读,以理解提示词窃取威胁并设计相应防护。

💡 推荐理由: 提示词是T2I模型商业化的核心资产,本文揭示的新型攻击可大规模窃取创意作品背后的提示词,威胁创作生态与知识产权保护。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)