#binary-code

共收录 1 条相关安全情报。

← 返回所有主题
推荐 8.5
Conf: 50%
👥 作者: Huaijin Wang, Shuai Wang

二进制代码表示学习是软件安全与逆向工程中的基础性难题,其目标是为二进制函数生成可供机器学习算法使用的嵌入表示。现有主流方法通常聚焦于函数级嵌入,通过对比学习或分类任务捕获不同函数之间的粗粒度语义相似性,但忽视了指令级粒度的对应关系。这种粒度缺失导致模型难以捕捉函数内部的控制流与数据流细节,也错失了编译器调试信息中蕴含的丰富监督信号。本文作者提出利用指令对齐知识来增强二进制代码表示学习:即通过显式地促使模型在嵌入空间中对齐同源或等价指令序列,从而学习更精细、更可解释的表示。初步实验发现,在函数级二进制代码相似性任务上微调过的模型,其内部产生的指令对齐程度显著高于预训练模型,表明指令对齐程度与函数级嵌入质量存在强相关。基于这一观察,作者设计了一种训练方案,将指令对齐作为辅助训练目标与函数级对比学习联合优化。实验结果表明,该方法不仅提升了函数检索的准确率,还使模型对相似性判断产生的置信度更具区分性,反映其对指令语义的建模能力更强。该研究的贡献在于揭示了指令级监督信号在二进制表示学习中的潜力,并提出一种将指令对齐融入训练流程的具体方法,为后续工作提供了新的优化方向。本文适合软件安全研究者、二进制分析工具开发者及从事恶意软件与漏洞研究的工程人员阅读。

💡 推荐理由: 该研究直接提升二进制相似性检索与漏洞搜索的准确性,对于安全分析中的代码复用检测、恶意样本聚类、补丁分析等场景具有应用价值,为构建更精细的二进制表示提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)