#security-repair

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Manar Alsaid, Chimdumebi Nebolisa, Faris Abbas

该论文针对大型语言模型(LLM)辅助 Terraform 基础设施即代码(IaC)安全修复的评估问题,提出了一种名为 TerraProbe 的五层预言框架。传统评估方式仅依赖静态分析工具的告警消失来衡量修复成功,忽视了规划有效性、行为变更及安全意图。TerraProbe 框架依次检查:(1)目标 Checkov 规则的移除情况;(2)全扫描器清洁度;(3)Terraform 计划的有效性;(4)计划变更的实质性比较;(5)人类专家的最终裁决。论文基于 68 个真实 Terraform 模块和 28 个受控注入缺陷模块,使用 gemini-2.5-flash-lite、GPT-4o 和 Claude 3.5 Sonnet 三种模型生成了 288 个修复。结果显示,目标 Checkov 移除率达到 83.3%,但全扫描器清洁度骤降至 10.4%,规划成功率仅 39.6%,计划比较可达率 38.5%。人类裁决进一步表明,在计划比较可达的真实修复中,71.4% 属于欺骗性修复(deceptive fixes),即通过所有自动化检查但仍保留原有漏洞。三种模型的欺骗性修复率在 57.1% 至 71.4% 之间,统计上无显著差异。论文还提出了四维欺骗性修复分类法,经评估具有较高信度(Cohen kappa=0.78, Krippendorff alpha=0.76)。IAM 权限分析显示,在全部 9 个 CKV2_AWS_11 欺骗性修复案例中,通配符资源授权始终存在。TerraProbe 提供了一个可复用的评估方法、复现包以及多层预言评估框架,旨在区分真正对齐安全意图的修复与仅通过扫描器的虚假成功。该研究对依赖 LLM 进行 IaC 修复的安全实践具有重要警示意义。

💡 推荐理由: 揭示当前 LLM 辅助 IaC 修复评估的致命缺陷——欺骗性修复普遍存在,即使自动化检查通过也不代表安全,安全团队应警惕自动化修复的假阳性成功。

🎯 建议动作: 纳入内部评估

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)