#prompt-tuning

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Chengkun Wei, Wenlong Meng, Zhikun Zhang 0001, Min Chen 0032, Minghu Zhao, Wenjing Fang, Lei Wang 0152, Zihui Zhang, Wenzhi Chen

该论文针对提示微调(prompt-tuning)范式中的后门安全威胁展开研究。提示微调因其在下游任务中的高效性和多任务服务能力而被广泛用于部署大语言模型,但作者通过实验证明,提示微调容易受到预训练模型中存在的任务无关后门(task-agnostic backdoors)的攻击。这类后门与具体下游任务无关,可影响任意下游任务,且现有最先进的后门检测方法因无法有效收敛后门触发器逆向过程而难以防御。为此,本文提出LMSanitator,一种针对Transformer模型的任务无关后门检测与移除方法。其核心思想是:不直接逆向触发器,而是逆向预定义攻击向量(即输入嵌入触发器时预训练模型的输出),从而获得更好的收敛性和后门检测精度。LMSanitator还利用提示微调中冻结预训练模型的特性,在推理阶段实现精确快速的输出监控和输入清洗。在多个语言模型和NLP任务上的大量实验表明,LMSanitator在960个模型上达到92.8%的后门检测准确率,并在大多数场景下将攻击成功率降至1%以下。该工作为提示微调的安全性提供了有效的防御机制。

💡 推荐理由: 提示微调是当前大模型落地的主流范式之一,但针对其安全性研究不足。本文揭示了任务无关后门这一新型威胁,并提出了首个可实际部署的检测与清除方案,对保障大模型服务安全具有重要意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)