#collaborative-optimization

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Xinting Liao, Behnoosh Zamanlooy, Masoumeh Shafieinejad, David B. Emerson, Ruinan Jin, Deval Pandya, Xiaoxiao Li

本文研究了文本协作提示优化(TCPO)中的提示注入风险。TCPO 扩展了 Textgrad 框架至去中心化设置,允许多个客户端联合优化大语言模型(LLM)的提示词,同时保持数据本地化。然而,TCPO 依赖自由形式的文本更新和聚合,引入了新的攻击面:恶意指令可被注入本地提示并通过服务器端聚合传播。与传统的提示注入攻击不同,攻击 TCPO 的目标是其协作优化循环,更具挑战性,因为恶意指令必须存活于聚合过程、在后续良性提示优化中持续存在,并规避服务器端防御。为揭示此风险,作者提出 CPInj——一种协作提示注入攻击,能够污染聚合后的全局提示词,降低下游任务性能,抵抗良性客户端的提示优化净化,并逃避基于检测的先进防御。实验发现现有防御方法对 CPInj 无效。为缓解该攻击,作者进一步提出一种防御导向的聚合方法 APAgg,可净化恶意指令并部分恢复 TCPO 的效用。在三个 LLM 家族和五个推理任务(数学、逻辑、医学)上的广泛实验表明,所提攻击揭示了 TCPO 的关键漏洞;尽管向缓解迈出第一步,但攻击仍然高度有效且远未完全解决,呼唤更鲁棒的 TCPO 防御。

💡 推荐理由: 提示注入是 LLM 应用的核心威胁,而 TCPO 作为新兴的协同优化范式,其攻击面尚未被充分挖掘。该研究首次系统性地探讨了协作优化过程中的提示注入风险,暴露了现有防御的不足,为安全社区提供了新视角。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)