👥 作者: Chang Liu, Edward Raff, Kristopher Micinski
该论文针对LLM反编译器评估标准提出质疑。当前LLM反编译器能将机器码还原为代码风格更干净的C代码,评估几乎只看输出是否可以重编译并顺利通过配套的输入/输出测试。作者Leu等发现这种度量会奖励错误轨迹:函数可以重新编译并通过所有提供的测试,却在其他合法输入上行为与原程序不一致;已披露的漏洞可能在反编译代码中悄然消失,崩溃路径完全不可见。为了弥补缺陷,论文提出Decompile-Diverge行为比较方法:它不依赖预先固定或手工构造的测试,而是针对每个函数自动合成驱动,从参考实现中生长模糊测试语料,再将原始编译代码与反编译、重编译后的代码放在同一批输入上,侦测行为偏差。实验涉及8个系统、9个配置,在已有LLM反编译语料上,通过全部测试的候选仍有4.9%在新增输入上与原程序不同,其中单一系统的最大偏差可达13%。在300个真实GitHub函数和287个CVE函数上,可重组性与行为一致性之间存在分离:例如某种基于LLM的修正能使Ghidra的构建率从75%升至90%,但行为匹配率却从74%跌至62%;在披露过的漏洞函数上,最多约一成输出出现'崩溃缺失',即漏洞不再触发。源码级分析显示,偏差源于LLM新增的字段、类型、被调函数和条件守卫,替代了传统工具遗留的可见未知项。
💡 推荐理由: LLM反编译器正在进入漏洞分析与恶意软件分析流程,若仅依赖重编译/通过官方案例作为正确标准,可能让分析师漏掉真实缺陷或遗漏漏洞崩溃。本文提供行为一致性视角,提醒安全团队不能默认'能编译就正确'。
🎯 建议动作: 研究跟进(建议在内部评估中试点行为比较方法,并跟踪下一步开源进展)
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kevin Burk, Fabio Pagani, Christopher Kruegel, Giovanni Vigna
反编译是逆向工程中的核心环节,也是恶意软件分析、漏洞研究等工作的重要前置步骤。虽然自动化反编译器能够将低级指令转换为近似的高级语言,但面对混淆、内联和隐晦的API使用,产出的伪代码经常难以阅读,仍需分析师花费大量精力进行人工梳理。既有研究主要关注如何改进反编译算法,而鲜少有工作从人类认知层次出发,追问为什么有经验的分析师能更快地得出正确结论。本文正是针对这一空缺,研究了人类专家在反编译过程中的真实行为,试图发现其中可学习、可复用的启发式模式。方法上,论文设计了与反编译相关的实验任务,收集参与者在任务期间的交互数据与口头报告(典型的认知任务分析),从中归纳出若干策略。可能的策略包括但不限于:先直觉性地根据字符串、符号表或API习惯建立对代码功能的大致假设,再围绕假设验证关键路径;在遇到复杂控制流时,先梳理数据依赖再还原语义;以及更偏好循环和递归结构的复原,因为这类结构便于建立心智模型。核心贡献包括提出了一个表征人类反编译行为的分类框架,并揭示了这些行为如何映射到对工具的功能期望。基于该框架,作者给反编译工具的交互设计提出了若干建议,例如集成上下文感知的符号提醒、允许分析者在图上记录假设、以及自动将二元结构映射为高层概念。实验部分,作者通过定量指标(如完成时间、准确度)与定性编码相结合,证实了上述策略的有效性差异,并发现某些被新手忽视的细节(如异常处理路径)往往是正确理解代码的关键。文章还讨论了自动化工具与人各自的能力边界,提出混合分析的设想。本文适合安全分析师、漏洞研究员、反编译工具开发者以及安全培训讲师阅读。尽管当前仅见摘要,但论文揭示的'人类如何思考代码'这一黑盒,可能为下一代人机协同的恶意软件分析工作台提供工程与教育方向。
💡 推荐理由: 该研究首次系统剖析人类反编译行为的认知模式。对蓝队而言,理解专家分析师的启发式策略可帮助优化恶意代码分析流程、设计与培训,减少经验差异带来的安全盲区,提升事件响应效率。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Varun Kohli, N Raghava, Biplab Sikdar, Dinil Mon Divakaran
本论文提出 CHISEL,一个无需测试套件的迭代式源码恢复框架,旨在改进二进制反编译的质量。传统反编译器(如 Ghidra)生成的伪 C 代码难以阅读且通常无法直接编译;而近年来基于大语言模型(LLM)辅助的反编译方法虽然能生成可读性较好的代码,但常存在语义错误。CHISEL 的核心思路是让 LLM 基于编译器静态分析和覆盖率引导模糊测试(动态差分分析)提供的反馈,对 Ghidra 生成的伪 C 代码进行多轮迭代修复。具体地,CHISEL 引入了富观测信号用于可解释的差异性检测与反馈、跨迭代的“差异记忆”(避免重复犯错),以及最佳候选保留策略,从而在不依赖任何人工编写测试用例的情况下,逐步逼近可编译且语义等价的源代码。作者在 120 个来自 ExeBench 的函数上做了系统评估,覆盖 x86-64 架构、四种编译优化级别(O0-O3)以及剥离与未剥离符号两种变体,并使用开源权重模型 Gemma4:31b 作为底层 LLM。实验结果表明,在启用全部推荐特性时,CHISEL 平均经过 2.1 次迭代即可达到 96.1% 的可重编译率和 79.8% 的可重执行率;尤其值得关注的是,它能够修复第一代生成代码中 26% 的执行错误。反馈判真器(oracle)的误接受率仅为 9.4%,说明其反馈信号具有较高的可靠性。此外,CHISEL 在两个最新 LLM 辅助反编译基线方法上取得了显著优于后者的表现。该研究对二进制逆向工程、恶意软件分析、遗留代码维护等场景具有参考价值。适合对 LLM 驱动的程序分析、反编译、以及基于反馈的代码生成感兴趣的安全研究人员和工具开发者阅读。
💡 推荐理由: 反编译是安全分析中常见但困难的任务,LLM 辅助方法经常产生看似合理但语义错误的代码。CHISEL 提供了一种无需测试套件的迭代反馈机制,可显著提升反编译代码的可用性,对恶意软件分析和漏洞研究有直接帮助。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Omar Abusabha, Sungjae Hwang
本文是一篇关于二进制反编译技术在现代计算环境中的系统性综述。反编译作为软件工程与安全分析的基础技术,旨在将机器码或二进制程序还原为高级语言表示,广泛用于恶意软件分析、漏洞挖掘、遗留代码维护和软件可追溯性验证。近年来,随着机器学习(ML)方法的引入,反编译技术取得了显著进展,但也面临新的挑战。本文首先回顾了过去数十年间发表的反编译研究,并对当前研究方法进行了全面的分类学梳理,构建了一个包含静态分析、动态分析、语义恢复、类型推断、结构化重建以及基于神经网络的端到端反编译等类目的分类体系。随后,论文系统检视了评估指标、常用工具和基准数据集的使用趋势,揭示了当前评估实践中缺乏可靠真值(ground truth)和标准化基准的问题,这导致不同方法之间难以进行公平、可复现的比较。本文还讨论了现代反编译系统在指令集多样性、代码混淆、编译器优化差异等方面的鲁棒性痛点。最后,作者基于对现有文献的分析,指出了未来研究方向,包括构建统一基准、融合人工先验与神经模型、提升跨架构泛化能力,以及将反编译与程序修复、代码克隆检测等下游任务结合。对于安全工程师、二进制分析工具开发者以及从事软件逆向工程的研究人员而言,这篇综述提供了清晰的领域全景和关键开放问题的梳理,有助于理解该领域的技术演化和潜在突破口。
💡 推荐理由: 反编译是恶意软件分析和漏洞挖掘的关键环节。该综述系统梳理了从传统方法到ML驱动反编译的演进路径,对蓝队人员评估工具能力、选择技术路线以及理解神经网络反编译的可靠性边界具有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Yibo Liu, Zion Leonahenahe Basque, Arvind S. Raj, Chavin Udomwongsa, Chang Zhu, Jie Hu 0031, Changyu Zhao, Fangzhou Dong, Adam Doupé, Tiffany Bao, Yan Shoshitaishvili, Ruoyu Wang 0001
本论文(arXiv 论文,标题为《Oxidizer: Toward Concise and High-fidelity Rust Decompilation》)提出了一款名为 Oxidizer 的 Rust 反编译工具或框架,旨在解决 Rust 二进制程序反编译结果不够简洁且保真度不足的问题。论文作者来自多个学术与安全研究机构(包括亚利桑那州立大学等),研究方向集中在程序分析、逆向工程与二进制安全。由于当前仅提供论文摘要(本输入中摘要内容缺失),无法获取具体的技术架构、实验设计或定量评估指标。从标题和学科背景推断,Oxidizer 可能利用 Rust 类型系统、所有权模型以及编译器中间表示等特有信息,来提升反编译代码的可读性和语义准确性,从而帮助逆向工程师更高效地分析 Rust 编写的软件。本文的主要贡献可能包括:提出一种针对 Rust 语言特性的反编译方案、设计新的中间表示转换或控制流恢复算法、以及在真实 Rust 编译产物上展示相比现有反编译器的改进。该研究面向安全分析人员、编译器开发者以及二进制逆向工程师,有助于提升 Rust 目标程序的漏洞分析与恶意代码检测能力。由于缺少具体摘要内容,所有细节均为基于标题的合理推断,阅读原文可获得确切结论。
💡 推荐理由: Rust 语言在安全敏感软件中日益普及,但现有反编译器对 Rust 特有结构(如所有权、枚举、trait)支持不足。Oxidizer 若实现简洁高保真反编译,将显著提升 Rust 二进制分析效率,有助于漏洞挖掘与恶意样本分析。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Minami Yoda, Jialong Li, Yasuyuki Tahara, Yuichi Sei, Yutaka Matsuno
本文针对物联网(IoT)固件漏洞检测中的反编译质量问题展开研究。IoT 设备常处理音频、视频、认证数据等敏感信息,其固件漏洞检测至关重要。反编译是关键技术之一,而基于大语言模型(LLM)的反编译工具虽能提供高可读性和高重编译成功率,但由于 LLM 依赖概率化 token 预测,其输出往往偏向语法正确性,可能生成与原始二进制语义不同的“看似合理”代码。漏洞常隐藏在错误处理流程、边界检查等细节中,这些细节容易在反编译过程中丢失。现有评估指标主要关注测试用例通过率,无法充分识别内部结构被改动但行为看似正常的代码,因此需要一种能从多个角度量化反编译代码内部结构的指标。为此,本文提出一个九维质量评估指标,涵盖结构相似性、行为相似性和语义相似性三大类。研究者以 OpenWrt(作为许多商业路由器基础的开源路由器平台)的 318 个程序为对象,使用五种方法(一种基于规则、四种基于 LLM)生成 19,625 个反编译结果,并进行统计分析。结果显示,重编译成功组的整体得分显著高于失败组(Cohen's d=0.92),其中行为相似性的效应量 d=0.96,结构相似性 d=0.69,证明这些指标是反编译质量的重要预测因子。该研究为量化 IoT 设备实现缺陷提供了统计评估基础,并提出了一个可推广至黑盒生成模型质量评估的框架。本文适合安全研究人员、固件分析工具开发者以及关注 LLM 输出可靠性的从业者阅读。
💡 推荐理由: 为评估 LLM 反编译工具提供多维统计指标,帮助安全分析师识别语义被篡改的伪正确反编译代码,避免因依赖错误反编译结果而漏报 IoT 固件漏洞。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhiping Zhou, Xiaohong Li 0001, Ruitao Feng, Yao Zhang 0019, Yuekang Li, Wenbu Feng, Yunqian Wang, Yuqing Li
反编译是将机器码转换为人类可读格式的关键技术,在缺少源码时辅助分析与调试。然而,反编译结果存在保真度问题,影响可读性和准确性。现有方法如变量重命名和结构简化只能部分解决,尤其在复杂的闭源二进制场景下,缺乏有效的检测和校正。为此,我们提出 FidelityGPT,这是一个新型框架,通过系统地检测和纠正反编译代码与原始源码之间的差异,提升反编译代码的准确性和可读性。FidelityGPT 定义了针对闭源环境的失真提示模板,并结合了检索增强生成(RAG)和动态语义强度算法。该算法根据语义强度识别失真行,从数据库中检索相似代码。此外,还设计了变量依赖算法,通过分析冗余变量之间的依赖关系,将冗余变量名整合到提示上下文中,以克服长上下文输入的限制。这些技术综合使 FidelityGPT 成为首个能够有效解决基于 LLM 的反编译优化中失真问题的框架。我们在二进制相似性基准的 620 个函数对上评估了 FidelityGPT,实现了平均检测准确率 89% 和精确率 83%。与当前最先进的 DeGPT 模型(平均修复率 FR 83%,平均修正修复率 CFR 37%)相比,FidelityGPT 表现更优,平均 FR 达 94%,平均 CFR 达 64%,显著提高了准确性和可读性,突显了其在增强反编译方面的有效性,并有望推动逆向工程的发展。
💡 推荐理由: 反编译是恶意软件分析与二进制漏洞研究的关键步骤,FidelityGPT 通过提升反编译代码质量,能帮助安全分析师更准确、高效地理解二进制行为,降低逆向工程门槛。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jens-Rene Giesen, Christian Scholz, Lucas Davi
该论文提出了一种基于语料库驱动的以太坊智能合约反编译方法,名为Code HarvETHter。反编译是以太坊安全分析的关键步骤,因为智能合约通常以字节码形式部署,难以直接分析。现有的反编译工具往往依赖于静态规则或模式匹配,存在精度低、可移植性差等问题。本文的创新点在于利用大规模智能合约字节码语料库来训练或指导反编译过程,从而自动学习字节码与高级语言结构之间的映射关系。该方法首先从公开的区块链数据集中收集大量已验证的智能合约字节码及其对应的源代码(如有),构建配对语料库。然后,设计了一种基于序列到序列学习的神经网络模型(或类似方法),将字节码序列映射为伪源代码。此外,论文还探讨了如何利用控制流和数据流分析来增强反编译结果的语义正确性,例如识别函数边界、变量类型和数据结构。通过在一个包含2000多个真实以太坊智能合约的数据集上进行实验,与现有工具(如Porosity、Vandal、Rattle)相比,Code HarvETHter在函数识别准确率、类型恢复和反编译代码的可读性方面均有显著提升。该研究对于智能合约安全审计、漏洞检测以及恶意合约分析具有潜在价值。
💡 推荐理由: 以太坊智能合约安全事件频发,而反编译是理解恶意或闭源合约的关键。现有反编译工具准确率不足,该论文提出的数据驱动方法有望大幅提升反编译质量,助力安全分析师快速定位漏洞。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Joshua Wiedemeier, Simon Klancher, Joel Flores, Max Zheng, Jaehyun Park, Sang Kil Cha, Kangkook Jee
本论文首次开展了大规模的人类辅助Python反编译实践研究。研究数据来自pylingual.io平台,涉及181,646个PYC二进制文件、9,003个用户提交的修补补丁以及393个经过准确性验证的补丁。论文分析了逆向工程师如何应对不准确的反编译结果,并识别出影响其达成准确反编译的关键因素。此外,作者还通过受控用户实验,将修补不完美Python反编译的技术难度作为独立变量进行考察。研究发现,用户通常需要手动修正反编译器输出的错误,且错误类型复杂多样,包括控制流、变量命名、类型推断等问题。实验结果表明,即使经验丰富的逆向工程师也需要耗费大量精力才能修复反编译输出。该研究为提升反编译工具的性能和用户体验提供了实证依据。
💡 推荐理由: Python反编译的准确性直接影响逆向工程效率,本论文首次提供大规模真实世界数据,揭示用户修补反编译错误的实践模式,对反编译器开发者及安全分析人员具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bercan Turkmen, Vyas Raina
本论文探讨了在缺乏源代码的情况下,利用大语言模型(LLM)对恶意软件进行二进制代码分类的问题。传统方法通常依赖单一反编译器生成的伪C代码作为LLM输入,但反编译器是有损的启发式工具,不同反编译器可能揭示同一二进制文件的不同特征。为此,作者构建了一个包含良性工具和恶意程序的基准测试集,覆盖多种威胁行为。每个样本分别使用Ghidra和RetDec进行编译和反编译,生成匹配的伪C视图。实验采用多个主流LLM家族(如GPT、LLaMA等),结果表明提供两种反编译器视图能够提升恶意类别的F1分数,主要归功于恶意样本召回率的提高。一致性分析进一步显示,Ghidra和RetDec产生的错误部分不同,表明两者提供互补信息。论文核心贡献是提出了一种简单、无需训练的多反编译器提示方法,可有效提升基于LLM的恶意软件分类在实际场景中的性能。
💡 推荐理由: 该方法无需额外训练或修改模型,仅通过输入多个反编译器视图即可提升LLM恶意软件分类的召回率,有助于安全分析师更准确地在海量样本中筛选出恶意程序,降低漏报风险。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kaihua Qin, Dawn Song, Arthur Gervais
智能合约反编译旨在从字节码恢复高级语言源代码,但现有评估方法存在数据集狭窄、指标不一致、语义一致性检查有限等问题。随着大型语言模型(LLMs)开始生成看似合理但语义可能偏离原始合约的Solidity代码,这一问题变得日益重要。本文提出SCDBench,一个基于LLM的智能合约反编译器数据集和评估基准。数据集包含600个真实Solidity合约,配有其字节码输入、真实源代码和可重放的语义检查点。SCDBench通过四个递进阶段评估反编译输出:格式完整性、可编译性、应用程序二进制接口(ABI)恢复以及通过差分重放实现语义一致性。作者在零样本反编译设置下评估了Claude Opus 4.7、GPT-5.3-Codex和GLM-5(包括有无扩展推理的变体)以及零样本编译修复设置。结果表明,前沿LLM通常能生成结构清晰且可编译的Solidity代码,但实现语义一致性仍远未解决:最佳模型仅完美反编译42/600个合约。进一步实验表明,引入同模型编译修复以适度成本显著提升了性能。SCDBench为严格且可重复的评估建立了共同基础,旨在加速开发用于区块链安全与透明性的可靠智能合约反编译器。
💡 推荐理由: 该研究为评估LLM在智能合约反编译任务中的表现提供了标准化基准,填补了现有评估方法的空白,对区块链安全审计、漏洞检测和合约分析具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Alexander Shypula, Osbert Bastani, Edward Schwartz
反编译器是逆向工程中用于从编译后的二进制代码重构源代码的重要工具。然而,由于编译器在将人类可读的代码转换为低级机器码时,会丢失高级语法、标识符和自定义数据类型等信息,因此从编译后的二进制代码中重构源代码是一项具有挑战性的任务。传统的确定性反编译器虽然实用,但在推断惯用语法和标识符名称方面存在困难。生成式AI模型天然适合重构高级语法、标识符和类型,但可能会产生幻觉,生成不正确的编程结构和语义。本文提出了Decaf(DECompilation with Automated Feedback,自动反馈反编译)系统,其核心思想是:不是通过更多数据和更多训练来改进神经反编译器,而是利用编译器反馈通过搜索来大幅提升神经反编译器输出的语义正确性。具体地,Decaf在反编译器生成多个候选代码后,使用编译器对候选代码进行编译并检查是否与原始二进制代码在语义上等价(例如通过比较执行结果或二进制相似性),从而筛选出最符合语义的候选。实验基于ExeBench数据集,在Real -O2优化级别上,Decaf将神经反编译的成功率从26.0%提升至83.9%,且不牺牲与原始源代码的相似性。此外,该自动反馈方法对于较弱的神经反编译模型同样非常有效。该研究为机器学习驱动的反编译提供了新范式,证明了结合编译器反馈和搜索可以显著改善反编译质量,对于逆向工程、恶意软件分析、遗留代码理解等领域具有重要价值。
💡 推荐理由: 该研究通过编译器反馈与搜索机制,显著提升了神经反编译器的语义正确性,解决了传统方法依赖大量训练数据且容易产生幻觉的痛点,为逆向工程、恶意软件分析和二进制漏洞研究提供了更可靠的自动化工具。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Han Dai, Soumyakant Priyadarshan, Abdullah Imran, Ruoyu Wang, Antonio Bianchi
该论文提出了一种名为SCRIBE的实用静态二进制补丁框架,旨在解决在没有源代码或原始工具链时,通过解编译后重编译进行二进制补丁的困难。现有解编译器(如Hex-Rays)输出的代码存在大量语法和语义不准确,导致重编译失败或补丁不正确。SCRIBE采用“二进制感知”重编译方法,从原始二进制中提取信息来修复解编译器输出的语义错误,从而提高重编译成功率和补丁正确性。评估表明,SCRIBE修复了Hex-Rays解编译器产生的约81%的错误函数,并成功为14个真实CVE中的13个生成了补丁,无需访问源代码或手动编辑汇编。用户研究显示,使用SCRIBE的18名参与者补丁成功率为100%,而不用时仅3.7%。此外,三个大型语言模型在SCRIBE框架下均实现了100%的补丁成功率,展示了全自动补丁的潜力。该工作使源码级二进制补丁变得可靠且易用。
💡 推荐理由: 该工作为安全工程师提供了一种无需源码即可对二进制进行可靠补丁的方法,解决了解编译器不准确这一长期痛点,可显著提升漏洞应急响应和遗留系统维护效率。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)