本论文聚焦于大型语言模型(LLM)在代码生成中的安全性问题,指出现有基准测试往往依赖明确指定的安全需求,无法覆盖真实开发中提示词模糊或不完整的场景。作者从开发者视角出发,识别出三类典型风险场景:模糊需求(Ambiguous Requirements)、未充分指定的操作上下文(Under-Specified Operational Context)以及安全-功能冲突(Security-Functionality Conflict)。基于这些场景,构建了一个包含2700个测试用例的大规模基准,用于细粒度评估LLM在真实条件下的安全性。对八款最新LLM的广泛评估显示,所有模型在风险场景下的平均漏洞率超过56%。进一步研究发现,安全感知的提示(security-aware prompting)可以显著降低这些风险,提升幅度高达45%。该工作为LLM代码生成的安全评估提供了更贴近实际的测试框架,并证明了简单提示工程对缓解安全问题的有效性。
💡 推荐理由: 该研究揭示了LLM代码生成在真实开发场景中的高漏洞率,并提供了可操作的缓解方向,对依赖LLM开发的安全团队具有重要参考价值。
🎯 建议动作: 研究跟进