本文介绍了一种名为 OASIS 的方法,旨在优化硬标签黑盒文本攻击中的攻击者序列。传统上,不同攻击方法遵循不同的搜索轨迹,且各自在不同样本子集上取得成功,但已有硬标签黑盒攻击主要关注改进单个攻击者,或通过手动方式简单组合多个攻击者。OASIS 的核心思想是:攻击者的组合方式本身就是一个可优化的目标,而非仅仅是一个实现选择。具体而言,OASIS 首先进行一次性的双目标攻击链搜索,在候选攻击者序列上同时平衡攻击成功率与扰动程度,从而选出最优的固定全局攻击链;随后在实际执行时复用一个参数固定的全局攻击链,避免了对每个样本重新搜索组合的额外开销。实验部分涵盖了多个数据集、受害模型以及大型语言模型(LLM)场景,结果表明 OASIS 在攻击成功率与扰动控制方面一致优于强基线个体攻击者以及简单人工构造的攻击链。该研究揭示了在多攻击者协作中,序列优化能够显著提升攻击效率,为后续研究提供了新的视角。论文属于计算语言学与对抗性机器学习交叉方向,适合关注文本对抗样本、黑盒攻击鲁棒性以及评估LLM安全性的研究者阅读。
💡 推荐理由: 硬标签黑盒攻击是评估文本模型鲁棒性的重要威胁;OASIS 表明攻击序列可被优化,意味着防御方不能仅防御单个攻击方法,而需考虑更复杂的组合攻击能力。
🎯 建议动作: 研究跟进,关注其攻击链优化思想以改进自身对抗鲁棒性评估。