#source-code-security

共收录 1 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Zhengdong Huang, Kevin Li, Jinqiu Yang, Yepang Liu, Lili Wei

本文针对源代码中硬编码密钥(hardcoded secrets)的检测问题展开研究。传统基于正则表达式的方法依赖可识别的模式,但真实密钥往往缺乏固定格式,导致精确率和召回率都不理想。近年来的方法尝试利用上下文信息,通过分析候选字符串周围的代码来推断其用途,但面临三个关键挑战:一是混淆鲁棒性差,模型过度依赖容易被混淆的标识符;二是跨语言泛化困难,原因是训练数据在不同语言上分布不均;三是上下文过长且噪声多,引入大量无关词元并拖慢推理速度。作者观察到,字符串字面量本身是代码语义的关键信息来源,具有较高的上下文密度、较好的混淆鲁棒性和语言无关性。基于此,他们提出 StringGroup,一种新颖的上下文提取算法,通过挖掘潜在密钥周围的字符串来构建更有针对性的上下文。该算法对现有检测模式进行简单修改,将分析范围缩小到字符串字面量,从而仅使用原有上下文的 33.2% 就能保留超过 80% 的语义信息,显著提高了秘密检测的信噪比。在此基础上,作者设计了基于 StringGroup 和 Transformer 模型的上下文感知秘密检测工具 Secretron。在 SecretBench 数据集上的评估显示,其 F1 分数达到 98.74%,并且在混淆和跨语言场景下具有很强的鲁棒性,优于当前最先进的基于 LLM 的基线方法。此外,作者已在真实环境中部署该工具,从 26 个应用中成功检测到 48 个此前未知的秘密密钥,验证了其实际有效性。本文适合软件安全研究人员、DevSecOps 工程师以及关注源码泄露防护的安全团队阅读。

💡 推荐理由: 硬编码密钥是常见高危隐患,现有工具漏报误报率高。Secretron 在压缩上下文的同时大幅提升检测精度,并表现出抗混淆和跨语言能力,为蓝队自动化发现源码中的真实秘密提供了更可靠的新方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)