该论文研究了大型语言模型(LLM)和小型语言模型(SLM)在生成基础设施即代码(IaC)时的安全性问题,特别是针对AWS Terraform配置。云配置错误是安全事件的主要根源,但业界对LLM/SLM能否生成符合安全规范的IaC缺乏系统性评估。作者选取了七个模型进行基准测试:三个闭源LLM(Claude Opus 4、GPT-5.4、Gemini 2.5 Pro)和四个开源SLM(Qwen2.5-Coder-14B、WizardCoder-33B、CodeLlama-13B、Magicoder-S-CL-7B),覆盖17个场景。研究将Checkov和Trivy扫描器集成到GitLab CI/CD流水线中,评估两种提示策略,并以pass@5作为安全合规性的度量。关键发现是:语法有效性和安全合规性在LLM生成的IaC中基本正交——能生成格式正确的Terraform并不意味着安全。例如,WizardCoder-33B的语法验证通过率高达77.8%,但Checkov合规率为0%;而Claude Opus 4在详细安全提示下Checkov通过率仅23.1%,但Trivy通过率达92.5%。因此,仅靠提示工程不足以确保安全,自动化多工具扫描仍是LLM辅助IaC生成的必要补充,无论模型家族或提示策略如何。所有实验工件均已公开。该研究为安全工程师和DevOps团队提供了重要的实证依据,表明在采用AI生成IaC时必须内置安全扫描环节。
💡 推荐理由: 为LLM生成IaC的安全性提供首个系统化基准,揭示语法正确不等于安全合规,强调自动化扫描在多模型场景下的不可替代性,对AI辅助云配置的落地具有直接指导意义。
🎯 建议动作: 研究跟进