本文研究了大语言模型(LLM)内部如何识别恶意代码的机制。尽管LLM在代码补全、漏洞检测等软件工程任务中表现优异,但其识别恶意或漏洞代码的内部工作机制仍不透明。作者采用机械可解释性方法,对三个指令微调的LLM(Llama3.1-8B-Instruct、Mistral-v0.3-7B-Instruct和Qwen2.5-7B-Instruct)进行了分析,利用PyPI Malregistry中的1500个恶意包和1500个良性包进行探测。实验首先通过线性探针定位前馈网络(FFN)中与恶意代码检测相关的神经元,然后通过因果干预(放大或抑制这些神经元)验证其作用。结果表明,放大促进恶意检测的神经元并抑制抑制性神经元可以提高分类准确率,而反向操作则会导致预测向单一类别崩溃,但该效果强烈依赖于具体模型。不同模型的护栏检测机制存在差异,其恶意代码检测行为在FFN层中的编码方式各不相同。该研究揭示了LLM编码恶意编程概念的方式,为神经元层级编辑、选择性遗忘和安全对齐等更可靠的防御机制奠定了基础。适合对LLM安全、可解释性和代码安全感兴趣的研究者阅读。
💡 推荐理由: 该研究首次从神经元层面揭示了LLM识别恶意代码的内部机制,为设计更可靠的LLM防御策略(如神经元编辑、安全对齐)提供了理论基础,有助于提升代码LLM在实际部署中的安全性。
🎯 建议动作: 研究跟进