#function-embedding

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Samuel Valenzuela, Johannes Kinder

本文针对二进制函数嵌入模型(binary function embedding models)中引入调用图(call graph)上下文信息所带来的影响展开系统剖析。此类模型通过将二进制代码片段映射为向量表示,服务于代码搜索、漏洞检测、恶意软件分类等逆向工程任务。现有方法大多仅以函数本身为输入,忽略了函数间的调用关系;部分工作尝试通过图结构信息增强嵌入,但对其效果缺乏深入评估。 作者以两个当前最优的二进制函数嵌入模型为基础,利用多种基于图的模型(如GNN)将过程间上下文融合进函数嵌入,并在多个基准上对比了有无上下文时的表现。实验结果显示:(1) 调用图增强确实能提升二进制代码相似性检测(BCSD)的精度,但这种提升并不能自动转化为下游语义或句法任务的增益;(2) 模型在语义相似性任务上优化时,往往会导致句法任务性能的下降,表明二者存在权衡;(3) 通过数据集的解释性分析,作者发现调用图上下文显著增强了嵌入的稳定性,尤其在原始模型表现不佳的困难场景下,鲁棒性提升尤为明显;(4) 上下文信息对命名空间相关函数(如库函数)的嵌入帮助更大,而对逻辑独立型函数的贡献有限,表明调用图的价值高度依赖于使用场景。 该研究首次系统性地解构了调用图增强在二进制函数嵌入中的局限性与适用条件,为后续设计更有效的上下文感知嵌入式模型提供了实证依据和方向指引。

💡 推荐理由: 二进制函数嵌入是漏洞检测、恶意代码分析等防御任务的核心技术。本文证明调用图上下文提升相似度检测并不必然改善下游任务,并揭示了语义与句法优化的矛盾。安全团队在部署此类模型时需警惕指标误区,避免因BCSD指标误判实际检测能力,应基于目标场景进行验证。

🎯 建议动作: 建议安全研究团队阅读全文,评估其结论对现有二进制分析工具的影响,并考虑在内部嵌入模型评测中加入下游任务验证。

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)