这篇论文针对 AI 智能体在网络安全领域的逆向工程(RE)能力评估问题,提出了一个全新且严格的基准测试 SRE-Bench。研究背景是:AI 智能体在源代码可用时已展现出强大的安全分析能力,但实际中许多关键软件(如恶意软件、固件、专有应用)仅以二进制形式存在,需要先进行逆向工程恢复语义才能分析。现有基准要么使用 LLM 训练集中可能出现的代码导致模型走捷径,要么规模不足。作者由逆向工程专家耗时 5000 多小时,从零构建了 19 个真实规模的私有程序(平均 16.9K 行代码),开发了 44 种内部反分析原语,生成了 262 个二进制实例和 1572 个可确定性评分的任务。他们在五个前沿大语言模型(GPT-5.6-sol、Claude-Opus-5、GPT-5.5、Grok-4.5、GLM-5.2)上进行了评估,发现最强模型 GPT-5.6-sol 在实例级别的平均得分仅为 61.4%,完全解决的比例只有 31.5%。进一步分析显示,智能体的行为与人类工程师显著不同,它们对编译器优化和静态链接的差异相对不敏感。受控消融实验证实,防止训练数据污染和保证真实规模都是构建有效基准的关键因素。这些结果表明,强大的源代码级安全能力并不会自动迁移到二进制分析场景,逆向工程仍是智能体网络安全的重大挑战,而 SRE-Bench 提供了一个严格衡量进展的测试平台。
💡 推荐理由: 该基准首次同时满足真实规模与无污染要求,揭示了前沿 LLM 在真实逆向工程任务上的能力天花板(完全解决率仅三成),为蓝队评估 AI 威胁情报和恶意软件分析工具的边界提供了重要参考。
🎯 建议动作: 研究跟进