#binary-reverse-engineering

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Xiuwei Shang, Li Hu, Xiao Jiang, Jieke Shi, Junda He, Zhou Yang, Shaoyin Cheng, Guoqiang Chen, Weiming Zhang, David Lo

本文针对人类导向的二进制逆向工程(HOBRE)评估难题展开系统性研究。HOBRE 旨在将反编译伪代码转换为更易读、更符合人类认知的表示形式,以降低逆向分析人员的认知负担。然而,如何可靠地评估 HOBRE 输出一直是核心挑战:人工评估成本高昂且难以规模化;现有自动化指标要么依赖可执行测试用例和运行时环境(真实世界二进制往往无法提供),要么需要高质量源代码作为参考(通常不可得),且无法捕捉语义等价但词汇多样的输出。鉴于大语言模型作为裁判(LLM-as-a-Judge)范式天然适合此类开放式评估任务,但此前缺乏系统验证。论文首次对 LLM-as-a-Judge 范式在 HOBRE 三个代表性任务(函数名恢复、二进制代码摘要、反编译优化)上进行了系统研究。作者构建了 BinJudgeBench——首个基于多维人工判断的、专家标注的、无参考评估基准。实验表明,LLM-as-a-Judge 与人工判断的平均相关性达到 63.20%,显著优于传统自动化指标(35.04%)。进一步分析不同基座 LLM、提示策略和解码温度等裁判配置后发现,不存在“一刀切”的配置,最优设置因任务和样本而异。为此,作者提出 BinJudge,通过轻量级路由机制为每个任务和样本自适应选择最优裁判配置。实验结果显示,BinJudge 将评估与人工专家的相关性提升 4.5%–24.7%,同时将 API 成本降低至静态最佳配置的 0.06 倍–0.84 倍,为 HOBRE 提供了一种可扩展、成本效益高且保真度高的自动化评估方案。论文还探讨了不同配置选择对评估结果的影响,为 LLM 评估领域提供了新的洞见。适合 NLP/软件工程/逆向工程评估相关研究者阅读。

💡 推荐理由: 该论文为二进制逆向工程产物的自动化评估提供了首个无参考、低成本、高保真的 LLM 裁判方案,可显著降低人工评估负担;其自适应路由思路也适用于其他 LLM 评估场景,对安全工具链的可靠性验证有参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)