推荐 5.5
Conf: 50%
本文提出 WeSCE,一个用于量化 LLM 驱动代码编辑过程中“安全漂移”的基准测试。在真实开发场景中,开发者常向 LLM 下达仅包含功能目标的编辑指令(如“增加一个排序功能”),并未显式提出安全要求,但代码修改可能引入或加剧安全漏洞。WeSCE 针对这一“弱安全约束”场景,构建了包含 400 个可执行真实世界代码实例的测试集,覆盖功能添加、功能删除、Bug 修复和代码重构四种常见编辑类型。为了量化安全漂移,作者提出了一种连续风险表示方法,通过统一公式将异构漏洞信号(如 CWE、CVSS 等)聚合为一个连续风险分数,从而支持对代码编辑前后风险状态的细粒度比较。在此基础上,定义了三种漂移度量:整体风险变化、最坏情况严重性变化、以及漏洞分布变化,分别从平均行为、极端风险和风险结构三个尺度刻画安全漂移。实验基于该基准评估当前主流 LLM 的代码编辑安全表现,揭示即使在简单功能需求下,模型也可能无意中引入或移除漏洞,且不同漂移度量之间可能存在不一致性。该工作为评估和提升 LLM 代码编辑安全性提供了标准化测试平台,并帮助安全研究者设计更安全的代码生成流程。
💡 推荐理由: 安全从业者需要关注 LLM 驱动代码编辑可能引入的隐性安全风险。该基准首次系统量化弱安全约束下编辑前后风险漂移,为安全团队选择、评估和监控 AI 辅助编码工具提供了可复用测试手段与度量指标。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)