#secret-detection

共收录 2 条相关安全情报。

← 返回所有主题
推荐 5.5
Conf: 50%
👥 作者: Zhengdong Huang, Kevin Li, Jinqiu Yang, Yepang Liu, Lili Wei

本文针对源代码中硬编码密钥(hardcoded secrets)的检测问题展开研究。传统基于正则表达式的方法依赖可识别的模式,但真实密钥往往缺乏固定格式,导致精确率和召回率都不理想。近年来的方法尝试利用上下文信息,通过分析候选字符串周围的代码来推断其用途,但面临三个关键挑战:一是混淆鲁棒性差,模型过度依赖容易被混淆的标识符;二是跨语言泛化困难,原因是训练数据在不同语言上分布不均;三是上下文过长且噪声多,引入大量无关词元并拖慢推理速度。作者观察到,字符串字面量本身是代码语义的关键信息来源,具有较高的上下文密度、较好的混淆鲁棒性和语言无关性。基于此,他们提出 StringGroup,一种新颖的上下文提取算法,通过挖掘潜在密钥周围的字符串来构建更有针对性的上下文。该算法对现有检测模式进行简单修改,将分析范围缩小到字符串字面量,从而仅使用原有上下文的 33.2% 就能保留超过 80% 的语义信息,显著提高了秘密检测的信噪比。在此基础上,作者设计了基于 StringGroup 和 Transformer 模型的上下文感知秘密检测工具 Secretron。在 SecretBench 数据集上的评估显示,其 F1 分数达到 98.74%,并且在混淆和跨语言场景下具有很强的鲁棒性,优于当前最先进的基于 LLM 的基线方法。此外,作者已在真实环境中部署该工具,从 26 个应用中成功检测到 48 个此前未知的秘密密钥,验证了其实际有效性。本文适合软件安全研究人员、DevSecOps 工程师以及关注源码泄露防护的安全团队阅读。

💡 推荐理由: 硬编码密钥是常见高危隐患,现有工具漏报误报率高。Secretron 在压缩上下文的同时大幅提升检测精度,并表现出抗混淆和跨语言能力,为蓝队自动化发现源码中的真实秘密提供了更可靠的新方案。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zixiao Chen, Mariko Wakabayashi, Charlotte Siska

该论文提出了一个名为 Secret Scanner Agent (SSA) 的多智能体大语言模型系统,旨在从非结构化的暴露文档(如电子邮件、聊天记录、工单、事件笔记)中提取泄漏的凭据及其关联的访问上下文(即“门”)。传统的秘密扫描器依赖正则表达式或训练分类器,在格式化代码上表现良好,但当凭据被碎片化、重新格式化或远离其解锁的资源时,难以有效工作,且仅报告秘密字符串而不指明其开启的资源。SSA 采用两个智能体协作:一个检测智能体优先保证高召回率,一个审查智能体负责过滤误报并恢复缺失的上下文。由于真实凭据数据敏感,研究团队在生成的合成基准上评估 SSA,涵盖 23 种秘密类型和多种文档格式,并通过程序匹配、LLM 裁判和人工审核的三步流水线评分。实验表明,跨六个模型,多智能体 SSA 相比单智能体变体提高了提取精度,尤其在门提取上提升了最多 16 个百分点。与正则表达式扫描器相比,SSA 的召回率提高了三倍以上,同时保持相当的精度;与十三名安全分析师相比,SSA 更精确,恢复的秘密-门对数量接近两倍,且速度快 5 至 17 倍。SSA 最终输出秘密、其对应的门以及支持证据,将凭据检测转化为可操作的发现,便于分类和修复。该工作为安全运营中的凭据泄漏检测提供了新的自动化方法,尤其适用于事件响应场景。

💡 推荐理由: 凭据泄漏是安全事件的高频诱因,传统工具难以从非结构化文本中同时提取秘密及其上下文。SSA 将多智能体 LLM 用于凭据提取,显著提升召回率和可操作性,可大幅减少安全分析师的手动排查工作量。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)