本文提出 DnD, 一种跨架构的深度神经网络反编译器 (DNN Decompiler), 旨在解决传统反编译器 (如 Hex-Rays) 依赖人工编写规则、难以推广到新指令集架构的问题。核心方法是将不同架构的汇编指令统一 token 化, 并利用基于 Transformer 或 LSTM 的序列到序列 (Seq2Seq) 模型, 将汇编指令序列翻译为可直接阅读的 C 语言伪代码。针对跨架构带来的 token 空间差异, 该工作设计了架构敏感的嵌入表示和共享子词单元, 使模型能够从多个架构的混合数据中学习通用语义。训练数据通过编译优化选项多样化生成, 并利用注意力机制对齐汇编与源码。实验部分在 x86、ARM 等架构的二进制上进行了评测, 生成的伪代码在语法正确性和语义相似度上优于传统工具, 且显著减少人工逆向的工作量。该工作展示了深度学习在二进制逆向中的应用潜力, 为后续 AI 辅助漏洞分析提供了基础。适合二进制安全研究员、逆向工程师和 AI 安全交叉领域学者阅读。
💡 推荐理由: 深度反编译技术有望大幅提升恶意软件分析和漏洞挖掘效率, 跨架构支持使安全团队无需针对每种 CPU 分别维护规则。理解此类技术也有助于评估攻击者利用 AI 辅助逆向带来的威胁, 提前调整代码混淆与防护策略。
🎯 建议动作: 研究跟进