#activation-probe

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Alizishaan Khatri

该论文研究一个核心问题:当大语言模型(LLM)读取一段C/C++代码作为上下文时,其内部隐藏激活(hidden activations)是否已经包含关于该代码是否存在漏洞的信号,从而可以在不运行额外静态分析工具或微调分类器的情况下,直接利用模型自身的表征来检测漏洞。当前针对LLM生成代码的防护多为事后机制,例如静态分析器、微调分类器或LLM评判器,这些方法忽略了生成模型自身的内部状态。作者从四个LLM(Granite-4.1-8B、Qwen3.5-9B、Qwen3.6-27B、Gemma-4-12B)中提取最后一个prefill token的激活向量,并训练MLP探针(probe)进行分类。这些探针的参数量仅为13.4M至16.0M,不到基础模型大小的0.2%。实验在四个函数级C/C++漏洞基准上进行:Devign、Big-Vul、Draper VDISC和PrimeVul。结果显示,探针平均F1达到41.7%。在Devign上,最好的探针(基于Qwen3.5-9B)达到68.8%的F1,与已发表的微调分类器SOTA(67.9%)持平,而这只是基于冻结的通用LLM的激活;但在更困难且类别不平衡的基准(Big-Vul、Draper VDISC、PrimeVul)上,探针与SOTA仍有较大差距。作者认为这是早期证据,表明编程LLM对任意代码的自身表征确实能提供关于漏洞状态的信息,为轻量级、模型原生的漏洞筛查提供了新方向。本文适合对LLM安全、代码漏洞检测、模型可解释性以及AI辅助安全审计感兴趣的研究人员和工程师阅读。

💡 推荐理由: 论文探索了利用模型内部状态进行漏洞检测的轻量级方案,可能为安全团队提供无需大规模微调或外部工具的实时筛查手段,开辟基于模型原生表征的检测新思路。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ivan Wiryadi

该研究针对AI编码代理生成代码的安全审查瓶颈问题展开。随着AI编码代理在生产环境中生成越来越多代码,人工安全审查的速度难以匹配代码生成速度。对于广泛使用的闭源权重模型,部署团队无法读取其内部结构,但可以使用开源权重模型作为代理输出的审查器,而该审查器的激活值是可读取的。研究者提出疑问:读取这些激活值是否能恢复仅向同一审查器提问所遗漏的安全信号。为此,他们对五个开源权重审查模型,在由成对的脆弱与修复后Python函数组成的语料上,为每个模型拟合了一个线性探针(linear probe),然后在训练中从未见过该弱点类型的真实公开漏洞上测试该探针,无需重新训练。实验结果显示,在通过更改单个函数修复的漏洞上,探针将脆弱函数排在修复后函数之上的比例在所有模型上均达到61%-67%,明显超过50%的随机水平。同时,该探针性能也优于同一模型通过其logits读取的YES/NO提示赢率,且在尝试的所有提示下均如此。而要求模型给出书面判断,即使使用思维链,在大多数情况下对脆弱函数和修复后函数返回相同答案,因此无法区分两者。最终结论是,模型激活中承载着仅通过提示同一模型无法获得的安全信息。该研究为利用模型内部激活进行代码安全信号检测提供了新思路和实证依据。适合关注LLM安全、AI代理安全及代码审查自动化领域的研究人员和安全工程师阅读。

💡 推荐理由: 该研究表明模型激活值能提取提示之外的安全信号,为LLM安全审查提供了新的非侵入式检测手段,有助于提升AI生成代码漏洞识别的准确率。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)