AKRASIA 是一种针对基于推理的代码大语言模型(Code LLM)的隐蔽后门攻击方法,由研究团队提出并评估。与现有攻击不同,AKRASIA 在推理阶段(inference-time)注入后门,通过探测目标 LLM 以构造代码级触发器,并利用上下文学习(in-context learning)实现后门学习,同时利用模型的不忠实行为(model unfaithfulness)来隐藏触发器并生成看似合理的推理链。研究测试了四种后门目标、六种推理型 LLM、三个编码任务/数据集及三种防御方法。实验结果显示,AKRASIA 在先进 LLM 上的平均攻击成功率(ASR)最高达 99.34%,同时保持最高 97.23% 的准确率(即防御方难以察觉功能退化)。在对抗当前最先进的防御方法时,AKRASIA 在 14/18 种防御设置中仍能保留平均高达 98.82% 的 ASR,并能在高达 80% 的设置中成功规避人工审查,隐藏触发器和推理步骤。该研究揭示了推理型代码 LLM 在面临后门攻击时的脆弱性,强调了开发针对推理后门防御的迫切性。论文适合 LLM 安全研究者、AI 安全工程师及代码模型部署方阅读,以理解这类攻击的机理并思考防御策略。
💡 推荐理由: 代码 LLM 在软件开发中应用日益广泛,AKRASIA 展示了推理型代码模型可被隐蔽植入后门且能逃避现有防御和人工审查,对供应链安全和 AI 代码生成工具的可信度构成严重威胁,安全从业者需警惕此类新型攻击。
🎯 建议动作: 研究跟进