本研究聚焦于“Vibe Coding”这一新兴开发范式,即通过自然语言提示由大语言模型直接生成完整Web应用程序,并探讨一个核心问题:在提示中显式加入安全需求说明,是否能够显著提升生成代码的安全性。作者设计了双提示词对照实验,选取六个功能各异的Web应用,每个应用分别生成两个仅在后缀安全需求章节上不同的变体:基准版本A和安全感知版本B。所有十二个程序均由同一智能体编码助手和同一模型版本在单轮非迭代生成中产出,随后通过静态分析、依赖检查、动态测试和人工审计相结合的方式进行评估,从85个候选问题中确认了75个真实发现。结果显示,安全感知变体在每个应用中的确认问题数量均更少(合计24个对比51个),且未出现Critical或High等级问题;最严重的问题仅能通过人工测试发现。作者强调,由于语料规模较小且每个变体仅生成一次,该研究属于描述性观察而非统计性验证,并将其定位为初步研究,后续计划扩展至多个模型并重复运行实验。该研究为评估LLM代码生成安全性提供了可复用的方法论,并初步表明提示中显式的安全引导可能有效降低漏洞密度,但仍需更大规模验证。适合安全研究人员、AI应用开发者及关注LLM输出安全性的工程团队阅读。
💡 推荐理由: LLM自动生成Web应用日趋普遍,但生成代码的安全水平缺乏系统性评估。本研究通过对照实验初步验证了在提示中显式加入安全要求可显著减少漏洞,为安全团队制定AI编码规范提供了直接证据。
🎯 建议动作: 研究跟进