该论文系统评估了前沿大语言模型在无人提示安全要求时编写代码的合规性,以及仅提及一次安全标准对结果的影响。研究选取三个模型(Claude Fable 5、Claude Opus 4.8、Claude Opus 5),在四个典型用例(S3 CLI、认证服务、RDS Terraform 模块、存储个人数据的文件上传处理程序)中,分别使用中性任务描述和追加一句“符合 SOC 2”的提示各生成一次代码,共得到 24 个输出。作者将 SOC 2 信任服务标准映射为二进制评分规则,并人工逐项验证所有失败与可疑行为。结果显示:无提示时合规率介于 47% 至 88%,且与“该控制是否为代码编写惯例”高度相关——密码哈希、存储加密等常见实践会被自动采用,而 S3 加固调用、日志留存、MFA 钩子等则缺失。中性提示生成的代码还包含真实可利用漏洞,包括可触达的 Werkzeug 调试器导致远程代码执行、未认证下载、返回全部姓名与邮箱的接口;其中第四个缺陷因条件语句计算而未被初版检查表识别。仅增加一句“符合 SOC 2”后,所有用例的合规率提升至 86%-100%,分数增长 23 至 50 分,且消除了所有不安全构造,但超出模型对任务概念范围的控制(如 MFA 钩子、Cookie 标志、账户生命周期)仍未被修正。模型间差异最小,同代模型在所有八个对比单元中仅相差一个评分项。论文还发现基于模式匹配的自动评分器不可靠,在 216 项判断中与语义判定有 27 处分歧,并漏过一个真实缺陷,因此需要以语义检查替代。研究贡献在于量化了安全提示对 LLM 生成代码合规性的效果,并揭示了当前评估方法的缺陷。适合 LLM 安全研究者、SOC 2 合规工程师及代码生成工具链设计者阅读。
💡 推荐理由: 揭示了大模型默认输出中潜在的高危缺陷与合规缺失,证明一句安全提示即可大幅改善;同时指出自动化评分工具的脆弱性,对蓝队评估 AI 生成代码风险具有直接参考价值。
🎯 建议动作: 研究跟进