大型语言模型(LLM)在AI驱动的信息技术生态中扮演核心角色。为降低有害或违规输出风险,商业系统采用先进的对齐策略和多层内容审核机制。然而,研究表明LLM仍易受对抗性操纵,尤其是越狱和提示注入攻击。本文提出GAS-Leak-LLM,一种基于遗传算法的新型越狱攻击方法,通过系统演化对抗性后缀来绕过安全约束。该方法在严格黑盒设置下运行,无需访问模型参数或内部结构,反映了部署系统中的真实威胁场景。通过迭代应用选择、变异和交叉启发式策略,该方法系统性地探索离散提示空间,识别高适应度的对抗性后缀。实验结果表明现有安全机制存在严重缺陷,并证实了所提攻击的有效性和实际可行性。本文揭示了LLM安全对齐的脆弱性,为防御方理解黑盒越狱攻击原理提供了参考。
💡 推荐理由: 展示了黑盒环境下基于遗传算法的LLM越狱攻击,暴露现有安全机制不足,对AI安全防御具有警示意义。
🎯 建议动作: 研究跟进