#dynamic-testing

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Nizhang Li, Zonghao Ying, Xiangfan Wu, Zonglei Jing, Xixun Lin, Hao Zhang, Wenxin Zhang, Jiaye Lin, Quanchen Zou, Xiangzheng Zhang

该论文提出 SkillSentry,一个针对大型语言模型(LLM)智能体外部技能(Agent Skills)的动态安全测试框架。研究动机在于:外部技能在扩展智能体能力的同时,引入了执行时攻击面——一个静态检查看似良性的技能,只有在特定环境状态、资源或交互历史条件下才会暴露有害行为。传统扫描器主要依赖静态分析、预定义规则或一次性语义判断,难以有效诱发和归因这类条件性行为。SkillSentry 的核心方法包括三个步骤:首先,推断技能预期的能力边界;其次,构建由 LLM 模拟的环境,并设置受控的诱饵资源;最后,自适应地生成任务来探索技能的行为状态。它通过对比启用技能与匹配的无技能执行轨迹,将可疑行为定位到源代码和已验证的执行轨迹上,从而做出最终判断。实验部分,作者在七个扫描器配置上评估了 SkillSentry,在标准基准上达到 99.50% 的召回率和 96.26% 的平均 F1 分数;面对语义保持性规避攻击时,平均 F1 为 92.95%,而最强基线仅为 80.07%。代码已开源。该框架代表了从静态分析向动态、自适应安全测试的转变,为检测智能体技能的条件性恶意行为提供了新思路。适合关注 LLM 智能体安全、安全测试工具开发以及 AI 供应链安全的研究人员与蓝队工程师阅读。

💡 推荐理由: LLM 智能体插件/技能的安全评估是实际部署中的关键环节。SkillSentry 提出的动态测试方法能更有效地捕捉静态分析漏报的条件性有害行为,对构建安全的智能体生态具有直接参考价值,蓝队可借鉴其思路强化对第三方技能的审查能力。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Nahum Korda, Gadi Evron

大规模代码库的自动化漏洞发现仍然面临挑战:传统静态分析误报率高,而动态方法(如模糊测试)需要大量基础设施且通常针对狭窄的漏洞类别。近年来,大型语言模型(LLM)的进展使得对程序行为进行语义推理成为可能,但将LLM应用于仓库级安全分析会遇到上下文管理、成本和验证方面的问题。本文提出OpenAnt,一个开源的漏洞发现系统,它将静态程序分析与基于LLM的推理集成在一个多阶段流水线中。OpenAnt引入了三项关键技术:首先,将代码库分解为自包含的分析单元,并通过从外部入口点的可达性进行过滤,将分析面缩减高达97%,同时保留与攻击相关的代码。其次,候选漏洞通过对抗验证进行审查,即通过受限攻击者模拟,模型在现实攻击者能力下评估可利用性。第三,通过动态验证确认发现结果,其中自动生成漏洞利用环境,在沙箱容器中执行,并在使用后丢弃。在包括OpenSSL、WordPress和Flowise在内的广泛使用的开源项目上的评估表明,该架构能够识别以前未知的漏洞,同时保持可管理的分析成本并大幅减少误报。研究结果表明,结合语义推理和漏洞验证的闭环漏洞发现流水线,为可扩展的自动化安全分析提供了一条实用路径。OpenAnt已在Apache 2.0许可下开源。

💡 推荐理由: 提供了一种实用的自动化漏洞发现方法,结合了LLM的语义理解与静态/动态分析,显著降低误报和成本,适合安全研究者借鉴。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)