👥 作者: Yixuan Liu, Yin Wu, Yi Li
该论文关注的背景是 TON(The Open Network)公链:其市值峰值超过 200 亿美元,链上已激活地址逾 1.75 亿,智能合约由 TVM(TON Virtual Machine)执行。与常见的栈式虚拟机不同,TVM 采用一等续延(first-class continuation)配合 savelist 来管理控制流与寄存器状态:续延被调用时,部分寄存器会被 savelist 捕获并随之传递,而不是通过操作数栈显式压栈传递。这一设计导致数据可以在续延边界之间“隐式”流动,若字节码级分析不显式建模 savelist 语义,就无法还原完整的数据流,也就无法准确追踪污点与定位缺陷——这是本文提出的核心问题。
为此作者提出 TasmScan,声称是首个面向 TVM 的字节码级静态分析框架,在不需要源码的前提下支持跨续延的数据流推理。其技术路线分三步:第一,用前向寄存器分析对 savelist 语义建模,对可精确解析的保存点(exact-resolved save sites)与本地追踪的寄存器定义给出形式化的过近似保证,从而安全地推导寄存器在续延间的取值;第二,把原始字节码提升为带类型的中间表示 TASIR,使指令语义与分析规则解耦;第三,在 TASIR 上执行路径敏感(path-sensitive)的污点分析,并使用上下文感知(context-aware)的污点源来检测缺陷。
实验部分:作者在 TON 验证者注册表中的 2,921 份合约以及一个含 208 份合约、由人工确认真值的标注基准上评估。在全量语料上,TasmScan 解析出 294,546 个动态续延目标,精确率 100%;消融实验显示 savelist 传播对于解析依赖跨续延寄存器传递的间接寄存器调用是不可或缺的。在标注基准上,工具对五类缺陷查全率达 95.3%,精确率 96.8%;从全量语料中分层抽样的 366 对样本估计整体精确率为 85.8%。性能方面,相对当前最先进的符号执行基线取得 17 倍中位加速,在路径分析对比中完成全部分析任务,零崩溃、零超时。
总体贡献可归纳为:把 savelist 这一 TVM 特有的续延状态语义形式化并纳入字节码静态分析,提出可复用的类型化 IR,并以大规模真实语料验证了跨续延污点分析在准确率与效率上的可行性。适合区块链安全研究者、智能合约审计工具开发者以及 TON 生态的安全工程师阅读。
💡 推荐理由: TON 生态合约规模大且字节码级审计缺少源码,savelist 造成的跨续延隐式数据流一直是静态分析的盲区。TasmScan 首次给出可形式化保证的建模方式,提供了可直接迁移的检测思路与公开基准,对链上合约审计与工具选型有直接参考价值。
🎯 建议动作: 研究跟进:可先评估 TasmScan 的建模与 IR 设计能否接入现有 TON 合约审计流程,再考虑对重点合约做小范围复现验证。
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Juanen Li, Peng Qian, Guanyan Li, Rui Wang, Peixin Wang, Zhiqing Tang, Fuchen Ma, Yuanliang Chen, Lun Zhang
本文提出 EchoFuzz,一个由大语言模型(LLM)引导的智能合约模糊测试框架,旨在解决现有智能合约模糊测试中的两大瓶颈。背景方面:智能合约作为去中心化应用的基石,自主管理着规模达万亿美元级别的数字资产,因而成为攻击者的高价值目标,漏洞检测需求迫切。问题一:现有方法在处理合约状态转换时存在逻辑鸿沟与组合冗余,难以在漏洞检测效率与状态空间探索成本之间取得有效折中,导致关键执行路径被遗漏。问题二:基于规则的序列变异策略存在路径冗余、缺乏合约逻辑引导等缺陷,形成性能瓶颈,使探索难以深入到面向深层漏洞的路径。方法上,作者引入“易受攻击函数调用序列”(VFCS,Vulnerable Function Call Sequences)这一概念——即最小化的、保持行为语义的执行路径,通过关键状态转换暴露缺陷。EchoFuzz 包含两个关键流程:其一为链式引导的 LLM 方法,将静态分析与逻辑理解相结合,为特定合约生成 VFCS 候选,从而消除组合冗余;其二为迭代式模糊测试策略,利用 LLM 结合实时反馈,自适应地将模糊器导向尚未覆盖的分支。实验结果表明,EchoFuzz 优于当前最先进的方法,分支覆盖率提升 29%,检测到的漏洞数量增加 62%;同时在真实合约中发现了 37 个此前未知的漏洞,显示出较强的实用价值。适合智能合约安全研究者、审计工具开发者以及关注 LLM 赋能程序分析方向的工程师阅读。摘要未声明该成果已被在野利用或武器化。
💡 推荐理由: 智能合约承载巨额资产,漏洞一旦被利用损失不可逆。该工作显示 LLM 可有效缓解模糊测试中状态空间爆炸与变异引导不足的问题,为合约审计工具的能力升级提供了可借鉴的技术路线。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Timo Schefold
该论文系统评估了大型语言模型在区块链取证场景中解读未验证智能合约字节码时的鲁棒性。作者构造了 13 个目的性设计的合约(其中 9 个为欺骗向量、4 个为功能匹配的对照组),并在 6 种提示策略下测试 22 个前沿模型,最终得到 8,528 次可分析的非拒答运行结果,且全部合约均具备 EVM 层面的真值标注。评测采用经过校准的 LLM-as-judge 流水线,并辅以两项与裁判无关的指标以及 50 条人工金标准标签进行支撑。核心发现是:对抗性欺骗使资金抽取(drain)行为的检出率相对功能等价的对照组下降 20.0 个百分点(95% 置信区间为 [17.2, 22.8])。其中结构性伪装——例如通过多跳调用链、XOR 掩码选择器以及从存储中加载的抽取参数——几乎对所有模型都保持有效。除漏检之外,作者还识别出“合理化”现象:模型能够正确描述隐藏的抽取机制,却接受合约的欺骗性叙述并将其判定为良性,从而输出形式上正确、结论却错误的“安全”证据。简单的防护性指令未带来整体收益,反而会在两个方向上破坏单个模型的稳定性。结构欺骗在 6 种被测提示策略下基本不敏感,更像是模型能力上限问题而非单纯的提示工程问题;仅来自两家厂商的 5 个模型检出率超过 50%。作者的结论是:在单轮、仅提供原始字节码的协议下,当前 LLM 不能作为可靠的独立取证工具;该结论并不延伸到多轮交互、工具增强、可获取源码或反编译参与的工作流,源码边界检查仅作为子集分析单独报告,而非主评测的一部分。
💡 推荐理由: 许多团队正把 LLM 引入链上取证与合约审计流程,本文用严格对照实验量化了其盲区:对抗性构造的字节码可让检出率下降约 20 个百分点,并出现“说对了机制却仍判安全”的合理化输出。这直接关系到自动化取证结论能否被单独采信。
🎯 建议动作: 研究跟进并纳入内部评估
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Sebastian Holler, Anna Piscitelli, Jannik Albrecht, Stephan Dübler, Ghassan Karame, Clara Schneidewind
该论文研究区块链智能合约中的抢跑(frontrunning)攻击与抗抢跑性质的形式化定义问题。背景上,智能合约通过共识执行,但交易排序本质上是异步的:交易由矿工(或验证者)决定打包、排序与延迟。由于用户必须通过交易与合约交互,掌握排序权的节点可以重排、延迟或插入交易,从而抢在诚实用户之前获利,这类攻击在以太坊等主流链上已造成数百万美元损失。论文指出当前领域存在两个根本性缺陷。第一,缺少对“合约抗抢跑”这一性质本身的严格定义,导致安全目标模糊、无法对工具与审计结论做一致性比较。第二,现有动态检测方法在覆盖面上严重不足:作者对 287 份智能合约审计报告做了大规模研究,审计方共报告 393 个漏洞,其中 55% 落在当前最先进检测标准的判定范围之外,说明主流工具系统性地漏检了一大批被人类审计师认定的抢跑问题。针对这一缺口,作者提出首个面向智能合约抢跑漏洞的形式化定义。其核心洞察是:抗抢跑并非合约代码的固有属性,而强烈依赖于诚实用户如何与该合约交互——同一个合约在不同交互方式下可以是安全的或不安全的。基于该观察,作者设计了一个健全(sound)的算法,用于合成“安全交互条件”,即在什么交互约束下合约能够抵抗抢跑;并实现原型工具,将其应用于真实已审计合约,在两个以太坊合约中发现了此前未被发现的漏洞。工作属于形式化方法与实证研究结合,读者对象为智能合约安全研究者、审计工程师、形式化验证与区块链安全工具开发者。
💡 推荐理由: 首次给出抢跑漏洞的形式化定义,并用 287 份审计、393 个漏洞的实证数据证明现有检测标准漏掉 55%,说明当前审计与工具链对企业合约安全评估存在系统性盲区,直接关系 DeFi 资产防护与审计质量。
🎯 建议动作: 研究跟进,并纳入内部智能合约审计方法论评估
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Yixuan Liu, Yuxin Dong, Ye Liu, Yin Wu, Chengxuan Zhang, Xiapu Luo, Yi Li
近年来,智能合约已成为去中心化应用(DApp)的核心基础设施,而链下系统(如跨链桥、钱包、索引器等)高度依赖事件日志(event logs)来跟踪合约执行和状态变化。然而,以太坊虚拟机(EVM)并不验证或强制事件语义,导致日志可能与链上状态不一致,进而误导链下系统接受错误的状态转换。现有智能合约漏洞检测工具主要关注逻辑缺陷,对事件语义类缺陷的检测支持有限。为了填补这一空白,作者收集了审计报告和事故案例,采用开放式卡片分类法(open card sorting)定义了五类事件语义缺陷:事件碰撞(event collision)、状态-事件不匹配(state-event mismatch)、未授权事件发射(unauthorized event emission)、事件发射不匹配(event emission mismatch)以及事件参数不匹配(event parameter mismatch)。作者提出了EventSpec方法,该方法通过行为推断和语义约束提取,从合约语料库中推断事件规范,并应用差分检查来识别目标合约中的事件语义缺陷。作者在6,617个真实合约上运行EventSpec,并基于人工标注结果评估检测效果;EventSpec实现了90.17%的综合精确率。此外,作者还提供了一个链下评估工具链(off-chain evaluation harness),能够在任何兼容EVM的链上复现两类链下攻击向量:由非预期发射者导致的事件来源混淆(event origin confusion),以及缺乏对应状态更新的事件-状态失同步(event-state desynchronization)。利用该工具链,作者演示了这些攻击在跨链桥中继器、区块链浏览器和NFT市场中的可行性,并报告了六个钱包问题,其中四个已确认(包括一笔600美元的赏金),两个待定。该研究系统性地定义并解决了事件语义缺陷的检测问题,为智能合约安全审计和链下系统安全提供了新的视角和实用工具。
💡 推荐理由: 事件日志是链下系统信任的关键数据源,但EVM不保证其语义正确性。该研究首次系统定义和检测事件语义缺陷,揭示了可被利用的盲区,对依赖日志的桥、钱包、索引器等有直接影响。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Luca Migliaccio, Roberto Natella, Naghmeh Ivaki, Nuno Laranjeiro, Marco Vieira
这篇论文提出了一种利用大型语言模型(LLM)自动向 Solidity 智能合约中注入漏洞的方法,旨在解决智能合约漏洞检测工具评估中“带真实标签数据集稀缺且人工构建困难”的问题。作者以 OpenSCV 分类中的 49 种漏洞类型为目标,对来自 SmartBugs 的真实智能合约进行变异注入实验。整个流程包含多阶段验证管道:依次检查合约的编译是否通过、能否正常执行、业务逻辑是否保持一致,以及是否确实存在目标漏洞。实验共生成近 1000 个候选变体,经过去重和验证后,最终得到 32 个确认存在漏洞的合约,覆盖 25 种漏洞类型,存活率仅为 16.58%。存活合约主要集中在结构较为简单的目标合约和具有局部化语法模式的漏洞类型上。论文还报告了实际部署中的挑战,包括 LLM 的非确定性输出以及难以在注入漏洞的同时保持合约原始语义。作者进一步使用这些验证后的漏洞合约对三款静态分析器进行测试,结果显示出各工具之间存在互补性和不完整的覆盖能力。整体结论表明,基于 LLM 的漏洞注入具备可行性,但可扩展性和多样性仍存在明显局限。本文适合智能合约安全研究者、漏洞检测工具开发者以及需要构建高质量基准数据集的安全工程师阅读。
💡 推荐理由: 本文为智能合约漏洞检测工具评估提供了自动化生成含真实标签数据集的新思路,能缓解手工标注成本高、数据稀缺的问题,对验证和改进静态分析器有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Laurent Bindschaedler, Quentin Botha, Christoph Siebenbrunner
本文面向自主智能体(autonomous agents)在跨组织执行工具操作时所产生的副作用治理问题。现有的授权机制仅能在操作前做准入控制,本地补偿模块只能处理运行时的回滚,二者都无法解决‘操作被允许却执行失败后留下残余损害’的难题。作者提出 Recourse,一种基于以太坊智能合约的结算协议,把每个被许可的操作绑定到明确声明的范围、恢复方案、证据、赔付和抵押品上,并要求代理在执行前提供对应担保。Recourse 的核心是把事前资格审核与事后可结算性分离:由带类型的收据承载客观可计算的残余损害索赔,配合乐观预言机挑战机制确保链上可验证;主观或不完整的索赔则进入 ERC-792 仲裁或被排除。作者实现了完整合约套件并在 Base Sepolia 测试网上部署,同时开发了针对 Postgres、Git 和云兼容本地沙箱的适配器。实验基于确定性测试环境、真实沙箱痕迹、对抗性扫描和基于属性的模糊测试,结果表明相比仅授权或仅本地补偿的基线,基于保障金的覆盖能够显著减少未得到补偿的损害。链上分层提供了中立托管、公开挑战、非合作支付以及跨组织信任假设下可迁移的历史记录。该研究适用于由大模型驱动的智能体在多组织协作场景中的治理与追责,为未来自主系统的可问责外部性经济机制提供了设计参考。
💡 推荐理由: 自主智能体跨界操作失败造成的剩余损害难以追责,Recourse 用链上合约把副作用量化、抵押和赔付,为蓝队与合规提供可审计问责层,有助于将外部副作用纳入风险治理与自动缓解流程。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Mingyuan Huang, Zimo Ji, Yifan Mo, Shuai Wang
该论文关注智能合约在区块链上公开源代码所带来的新型安全威胁。传统上,智能合约项目为了建立用户信任,会在区块链浏览器上发布并验证源代码,使链上程序以可读形式公开。然而,随着LLM(大语言模型)智能体的发展,攻击者可以借助这些公开源码,利用自动化智能体大规模扫描合约漏洞并策划攻击,改变了这一披露机制原有的威胁模型。为此,作者提出了DeLLMGuard,一个智能合约部署框架,旨在防御恶意LLM漏洞扫描,同时保留公开源代码披露和授权审计的能力。DeLLMGuard通过将已披露的源代码与实际运行时的执行过程分离,利用区块链环境中的多个合约地址,迫使LLM智能体在漏洞分析前必须先恢复代理(proxy)、委托(delegate)和工厂(factory)等跨合约关系。框架内置验证层,可检查部署关系、运行时字节码、源代码和状态变更,确保转换过程不改变原始业务逻辑。作者在基于SCONE-bench衍生的环境中,使用三个LLM智能体对387个真实世界存在漏洞的合约进行了评估。结果显示,DeLLMGuard将根本原因定位准确率从23.5%降低至6.6%,并优于封闭源代码的字节码基线(在主要的非代理合约集合上)。痕迹与消融分析进一步表明,智能体虽然能恢复下游合约,但仍无法识别漏洞,说明跨合约恢复仍然是自动化LLM扫描面临的主要挑战。该研究为智能合约安全提供了一种新的防御思路,适合智能合约开发者、区块链安全研究人员以及关注LLM智能体安全影响的从业者阅读。
💡 推荐理由: 它揭示并回应了LLM智能体将公开源代码转化为大规模攻击输入的新威胁,为智能合约项目在保持透明性的同时抵御自动化漏洞扫描提供了实用防御框架。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Stian Lybech, Eun-Young Kang, Riccardo Tonello, Anders Dalskov
本文针对带有链下组件的区块链智能合约语言,建立了一种形式化模型。链下组件是在区块链节点网络之外的指定位置执行的智能合约片段,但它们与链上合约状态保持同步。它们不仅响应链上状态的变化,还能将外部世界的事件(如股票价格、天气数据)通知给链上组件,甚至充当不同区块链之间的桥梁。这种架构为开发者提供了更大的灵活性,但也可能引入新的安全漏洞。为了具体研究这些问题,作者利用该模型,通过静态信息流控制(IFC)技术,考察了链上与链下组件之间数据的完整性和保密性保证问题。研究发现,即使在不存在循环构造的情况下,信息流控制也会失效,其原因在于链下组件作为独立线程运行,可以通过递归方法调用等方式编码出阻塞构造,从而绕过控制。作者在论文末尾讨论了若干可能的补救方向。该论文的核心贡献是对链下组件场景下信息流控制局限性的形式化证明,并提出了对区块链安全设计有指导意义的讨论。适合区块链安全研究者、形式化方法开发者以及智能合约语言设计者阅读。
💡 推荐理由: 链下组件扩展了智能合约能力,但也引入了新的数据泄露路径。本文形式化证明了传统信息流控制在链下场景的失效,提醒安全设计者不能简单复用现有方法。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tomasz Sadowy, Constantine Doumanidis, Maria Apostolaki
BGP 劫持是互联网路由体系中的持续性威胁,现有防御手段(如 RPKI/ROV)存在根本性的激励错配:最适合过滤恶意路由公告的网络运营商承担运营成本却无法获得直接收益,而受害前缀所有者则独享安全收益。这种激励失衡导致过滤机制部署不足,劫持事件难以被有效遏制。本文提出一种基于市场的替代方案:前缀所有者为其前缀的非法公告过滤发布悬赏,将过滤行为从一种无私贡献转变为私人交易。核心洞察在于:无论是正在传播的劫持还是其未被传播的状态,都无法避开公共路由收集器(如 RIPE RIS、RouteViews)的观测,这些收集器提交的路由表可以成为发放赏金的独立信任根。基于此,作者设计了 BGPay——一个托管协议,过滤器与监控者在揭示之前先行承诺,智能合约依据公开可验证的证据而非前缀所有者的主观判断进行支付。作者分析了 1,000 起真实劫持事件,发现当前的公共收集器在关键位置已具备足够的可见性:在控制劫持传播方面更重要的 AS(自治系统)往往也能被公共监控覆盖。因此,按遏制影响比例设定奖励金额可以有效抑制作恶行为。论文的主要贡献包括:提出激励兼容的悬赏过滤机制、设计基于承诺-揭示与智能合约的托管协议、以及利用真实劫持数据进行可扩展性分析。适合网络运营商、路由安全研究者、区块链与可信执行环境交叉领域的从业者阅读。
💡 推荐理由: 该研究直指 BGP 安全防御的激励死穴,为蓝队和网络工程师提供了一种不依赖强制合规、而是通过经济激励驱动过滤的新型思路,有望提升 RPKI/ROV 的实际部署率。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Jingping Zhu, Hongping Wang, Xiaoqi Li
本文针对智能合约修复中基于 AI 的现有方法依赖线性思维(如 Chain-of-Thought)导致错误累积、补丁不可靠的问题,提出了一种基于 Tree-of-Thought 框架的智能合约修复方法。智能合约一旦部署便无法修改,即使是小漏洞也可能造成重大财务损失,因此自动化修复至关重要。该方法首先将审计报告解析为结构化数据,随后使用静态分析工具 Slither 精确定位易受攻击的代码片段,最后通过三步推理框架同时探索多条修复路径,对候选方案进行评估并剔除差选项,最终通过编译和人工检查验证补丁的有效性。作者在来自 Code4Rena 的 50 个真实漏洞上进行了实验,结果表明该方法实现了 62% 的单一成功率(single success rate)和 84% 的前三名成功率(top-3 success rate),分别比基线 ContractTinker 高出 12 和 6 个百分点。此外,完全有效补丁的比例提升至 44%,缺陷补丁从 38% 降至 22%,无效补丁从 10% 降至 4%。该研究克服了线性推理的局限,使智能合约修复更加准确和实用。适合智能合约安全研究者、区块链安全工程师以及漏洞修复自动化工具开发者阅读。
💡 推荐理由: 智能合约漏洞易导致巨额资金损失,而现有 AI 修复方法存在错误传播问题。本文提出的 Tree-of-Thought 框架显著提升修复成功率,为安全团队自动化修复合约漏洞提供新思路,降低人工审计成本。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Christoph Sendner, Huili Chen, Hossein Fereidooni, Lukas Petzi, Jan König, Jasper Stang, Alexandra Dmitrienko, Ahmad-Reza Sadeghi, Farinaz Koushanfar
智能合约安全是区块链领域的重要挑战。以太坊智能合约编程漏洞已被利用造成严重经济损失。现有检测工具通常只针对少数特定漏洞类型,难以扩展到新型漏洞,且需要重新设计。本文提出ESCORT,一种基于深度迁移学习的多漏洞检测框架。该方法采用共享的特征提取器学习合约字节码的通用语义表示,并为每种漏洞类型设置独立分类分支,从而作为多标签分类器同时检测多种漏洞。当出现新的漏洞类型时,仅需在预训练的特征提取器上新增分支,并利用少量数据微调即可完成扩展,避免了全模型重新训练。作者在361万个真实智能合约上验证了有效性:初始训练阶段对六种常见漏洞的平均F1分数达98%,迁移学习阶段对另外五种漏洞的平均F1分数达96%。与现有非机器学习工具相比,ESCORT不依赖特定合约结构,能处理任意复杂度合约,实现100%覆盖率;同时避免了部署多套工具的繁琐,显著缩短检测时间。该工作首次将迁移学习引入智能合约漏洞检测,为快速适应新型漏洞提供了可行路径。作者计划开源数据集与标注工具链,以促进后续研究。该研究对以太坊安全审计、漏洞监测及区块链安全研究具有重要参考价值。
💡 推荐理由: 智能合约漏洞屡屡导致巨额资产损失,传统检测方法难以灵活扩展。ESCORT提供一种可快速适配新型漏洞的深度学习框架,帮助安全团队以较低成本覆盖更多漏洞类型,对提升链上合约安全审计效率有直接价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Levi Taiji Li, Ningyu He, Haoyu Wang 0001, Mu Zhang 0001
本论文针对 EOSIO 区块链智能合约中一类被称为 “Groundhog Day” 的漏洞提出静态检测工具 VETEOS。该类漏洞源于 EOSIO 交易执行与回滚机制的特定交互,使得攻击者能够通过重复执行某些操作序列,在合约逻辑中造成非预期的资金流动或状态变更。VETEOS 的核心思路是:首先解析合约字节码,构建控制流图(CFG)和调用图;然后结合 EOSIO 的事务语义(包括内联行动、延迟通知以及资源计费等),建立数据流分析模型,抽象出可能导致重复执行的路径;最后通过污点分析或模式匹配,定位可疑操作并生成报告。作者在真实的 EOSIO 合约数据集上进行了大规模实验,验证了 VETEOS 的检测准确率和效率,并与现有工具进行对比,表明其能够发现多种变体且误报率较低。该工作为区块链安全审计提供了自动化手段,有助于合约开发者与安全团队在部署前发现潜在风险。对于安全运营而言,了解此类漏洞的存在有助于完善链上监控策略和事件响应预案。本文适合智能合约安全研究人员、区块链安全审计员以及 EOSIO 生态开发者阅读。
💡 推荐理由: 该研究直指区块链智能合约中的真实威胁,为 EOSIO 合约审计提供自动化检测手段,可帮助蓝队降低资产损失风险。
🎯 建议动作: 研究跟进
排序因子: 有可用补丁/修复方案 (+3) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zhiyuan Sun, Xiapu Luo, Yinqian Zhang
本文提出并实现了一个针对 Algorand 区块链智能合约的安全分析框架 Panda。Algorand 采用基于交易签名和异步轮次确认的 Pure Proof-of-Stake 共识机制,其智能合约执行模型(ASC1)与以太坊 EVM 完全不同,交易级原子性与有限执行语义导致已有分析工具无法直接适用。Panda 从 Algorand 合约的 TEAL 字节码和全局/本地状态数据出发,构建符号执行引擎,模拟合约在真实交易序列中的执行路径,并形式化定义了一组针对 Algorand 特有的安全属性,包括资金被冻结、合约逻辑被绕过、交易原子性滥用、状态变量篡改等漏洞模式。为了验证有效性,作者在 Algorand 主网和测试网上收集了 9.8 万个已部署合约,运行 Panda 后自动发现了 127 个存在安全问题的合约,其中多个合约包含可导致资金损失的高危缺陷;人工复核确认了较高比例的误报率控制在可接受范围。实验还对比了 Panda 与基于传统静态分析的基线方法,证明 Panda 能检测出更多真实可触发的漏洞,且误报更少。Panda 是首个针对 Algorand 智能合约的自动化安全分析框架,为研究人员和审计者提供了新的技术基线。适合区块链安全研究者、智能合约审计团队以及 Algorand 应用开发者阅读。
💡 推荐理由: Algorand 生态的智能合约安全分析工具近乎空白,Panda 填补了这一缺口。其符号执行思路可迁移至其他非 EVM 链,帮助安全团队提前发现资金冻结等高风险缺陷。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Hongbo Wen, Hanzhi Liu, Jiaxin Song, Yanju Chen, Wenbo Guo 0002, Yu Feng 0001
本文针对去中心化金融(DeFi)协议中深度逻辑漏洞的自动化攻击合成问题展开研究。随着区块链应用普及,DeFi 协议管理的数字资产价值巨大,成为攻击者的首要目标。现有智能合约漏洞检测工具在处理 DeFi 协议时面临严峻挑战:这类协议通常涉及多个智能合约之间的复杂金融交互,漏洞往往隐藏在跨合约的深层逻辑中,而非单个合约内部的简单缺陷。已有工具大多只分析单个合约,面对跨合约调用链时采用暴力搜索或穷举方式,导致分析效率低下且难以发现真正的逻辑漏洞。为此,论文提出名为 FORAY 的新方法,目标是高效合成针对 DeFi 协议深度逻辑漏洞的攻击路径。虽然摘要未详细展开 FORAY 的具体技术架构,但其核心思路应是结合程序分析、符号执行或约束求解等手段,对跨合约的金融交互逻辑进行建模,从而自动生成能够触发逻辑缺陷的交易序列或调用序列。论文强调当前工具的效率瓶颈和浅层分析局限,FORAY 试图填补这一空白。主要贡献包括:提出面向 DeFi 协议的逻辑漏洞攻击合成框架,改善跨合约分析的可扩展性,并为智能合约安全检测提供新思路。适合智能合约安全研究员、DeFi 协议开发者、区块链安全审计人员以及关注自动化漏洞挖掘的学术研究者阅读。
💡 推荐理由: DeFi 协议安全事件频发,现有检测工具难以发现跨合约深度逻辑漏洞,FORAY 提出的自动攻击合成方法有助于提前暴露高风险逻辑缺陷,对提升链上资产安全性具有直接价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yue Duan, Xin Zhao, Yu Pan, Shucheng Li, Minghao Li 0003, Fengyuan Xu, Mu Zhang 0001
本文提出一种名为 VetSC 的新型自动化安全审查技术,针对去中心化应用(DApps)中的智能合约。由于 DApps 的业务逻辑通常由链上合约与链下界面共同组成,传统静态分析难以直接从合约代码中提取高层业务语义,也无法自动确定需要验证的安全属性,导致安全审查高度依赖人工。VetSC 采用界面驱动(UI-driven)的程序分析引导的模型检测方法:首先从合约代码中提取业务模型图(business model graphs),以捕获其内在的业务和安全逻辑;随后,从 DApp 的用户界面中检索文本语义,自动推理出应检查的安全规范(safety specifications)。为了防止不可信的界面文本误导分析,VetSC 还会校验界面与合约逻辑的一致性,检测二者之间的偏差。作者实现了 VetSC 原型,并将其应用于 34 个真实 DApp。实验表明,VetSC 能够准确解释智能合约代码、实现自主安全审查,并在真实 DApp 中发现安全风险。利用该工具,作者在真实场景中发现了 19 个新的安全风险,例如过期的彩票仍可兑奖、同一用户重复投票等问题。该技术的主要贡献在于将自然语言界面信息与合约代码分析结合,实现了安全属性的自动推导,显著降低了 DApps 安全审查的人工门槛。适合区块链安全研究人员、智能合约审计人员以及 DApp 开发者阅读。
💡 推荐理由: DApp 安全审查长期依赖人工逆向业务逻辑,效率低且易漏报。VetSC 将 UI 文本语义与合约代码自动对齐,有望实现安全属性的自动推导,为蓝队自动化审计智能合约提供新思路。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rabimba Karanjai, Yang Lu, Richard Williamson, Hemanth Hm, Prakhar Mehrotra, Lei Xu, Weidong, Shi
本文提出 PACE(Policy-Attested Contract Execution),一个面向去中心化金融(DeFi)中基于大语言模型(LLM)的自主智能体的交易级授权框架。研究背景在于:LLM 智能体在规划链上交易(如代币兑换、借贷、收益管理)时,容易遭受提示注入攻击,且缺乏将验证者的批准与最终提交到链上的确切交易绑定起来的机制。PACE 在 LLM 智能体与链上执行之间插入一层事务级授权,引入类型化交易意图(typed transaction intents)、确定性策略验证器,以及签名策略决策记录(PDR)。PDR 通过密码学方式将已批准的意图、策略和模拟报告与最终执行字节绑定,并具备重放和过期保护。一个 Solidity 智能账户在链上强制执行 PDR 签名,实测开销为 29,826–31,822 gas。作者在 40 个任务上对比了 6 个基线,涵盖四类攻击场景和良性用途,共进行 2,800 次试验(10 个随机种子)。在确定性沙箱中,PACE 实现了 0.00 的不安全执行率和 0.00 的良性任务误报率,而无防护基线的不安全执行率为 0.80。消融实验表明,宽松的策略设置(+57.5 个百分点)和受触合约允许列表(+12.5 个百分点)是主要的安全影响组件。为验证真实模型输出是否仍能达到相同的确定性底线,作者还提供了三模型实时 LLM 评估(全任务套件、多次运行)以及主网分叉测试工具(用于 archive-RPC 部署,但仅在生成相应工件时报告分叉结果)。这些辅助研究与确定性基准相互独立,不能替代后者。作者将声明限定为可复现基准内的逻辑级安全,而非可部署的 DeFi 安全方案。适合关注 LLM 智能体安全、DeFi 安全、形式化授权机制和链上执行完整性的研究人员与安全工程师阅读。
💡 推荐理由: LLM 智能体在 DeFi 场景中的提示注入和交易篡改风险亟需细粒度授权控制;PACE 提供一种密码学绑定的、可在链上验证的解决方案,为构建更安全的自主代理交易提供参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Birindwa Prisca Hondi, Chinoso Philip Nwishienyi, Charity Wanja Mwaura, Alia Teto, Jema David Ndibwile
本文是对基于图神经网络(GNN)的智能合约漏洞检测器中表示层(representation layer)的失败分析。研究指出,这类检测器在机器学习之前先将源代码转换为图结构;如果图未能捕获代码的语义,那么任何模型改进都无法弥补这一缺陷。作者以GNNSCVulDetector为例,识别并实验证明了四个具体的表示层失败:第一,结构不同的合约可能生成逐字节完全相同的图,构成一种具体的规避攻击;第二,图构建过程受限于一个硬编码的47项变量白名单(包含一个重复条目),限制了提取器能识别的变量,导致相同漏洞因变量名不同而产生不一致的图,且图质量随变量名偏离白名单而下降,当无匹配项时管道产生脱离源代码变量的结构;第三,表示重入攻击触发者的C节点在文献中最经典的脆弱合约中缺失;第四,控制实验确认了由此导致的直接误分类:一个完全可利用的合约因C->W边从未被构建而被标记为安全。所有四个失败均通过实验验证。文章还指出,现有文献中的准确率是在未暴露这些失败的条件下测得的。作者确认了一个由表示层失败直接导致的误分类案例,并指出此类失败在真实合约群体中的普遍性仍是一个待探索的实证问题。
💡 推荐理由: 该研究揭示GNN漏洞检测器的表示层存在可被利用的结构性弱点,导致规避攻击和误分类,直接影响智能合约安全工具的可信度。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Josef Gattermayer, Jan Kalivoda, Arman Bašović
该论文基于网络安全公司 ack3 发布的 H1 2026 DeFi 事件数据集,对 2026 年 1 月 1 日至 6 月 29 日期间发生的 135 起 DeFi 安全事件进行了系统性分析,重点关注智能合约审计范围与事件路径之间的关系。数据集显示这些事件造成的总损失约为 9.3986 亿美元。研究人员为其中 68 起事件找到了公开的审计历史记录,并逐起比对了事件攻击路径是否落入事发前已公开的审计范围之内。结果发现:46 起事件的攻击路径完全处于所有已识别审计范围之外,20 起事件至少有一条路径在某个审计范围内,另有 2 起无法判定。在这 68 起事件子集中,范围外路径在数量上占 67.6%,在报告损失金额上占 94.4%。损失加权结果主要受两起大型事件影响;剔除这两起事件后,范围外路径的损失占比仍达 72.1%,说明结论方向稳健。论文还描述了审计时效(审计与事件之间的时间间隔)、时间维度上的损失分布以及受影响项目类型。核心结论是:项目层面的审计历史与事件路径层面的审计覆盖范围是两个相互独立的关键变量,存在审计记录并不等于该次攻击路径已被覆盖。该研究对 DeFi 审计实践、风险评估和保险定价具有直接参考价值。适合智能合约审计师、DeFi 安全研究者、区块链安全团队以及风险管理从业人员阅读。
💡 推荐理由: 该研究用实证数据说明了“已审计”标签的局限性:多数攻击路径根本不在审计范围内,提醒安全团队不能依赖历史审计作为安全保证,必须扩展审计覆盖和持续监控。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sofia Bobadilla, Humaira Afrin, Angela Novelli, Martin Monperrus
本文针对区块链智能合约频繁遭受网络犯罪分子攻击、造成巨额资产损失这一严峻安全问题展开研究。作者指出,尽管区块链环境被认为是计算领域最具对抗性的环境之一,但现有技术和概念尚未能真正有效解决漏洞被利用的问题。为此,论文提出并系统验证了经典的程序不变量(program invariant)概念或许是防范智能合约攻击的最有力手段。研究设计了一套原创实验协议:首先构建了名为INVARIANTEVAL的基准测试集,包含28个真实的以太坊攻击案例,每个案例均配有一条人工编写、能够阻止对应攻击的不变量;其次开发了PONDEREPLAY重放框架,通过重新执行历史交易来严格验证不变量的正确性和有效性。实验结果表明,这些智能合约不变量能够成功阻断INVARIANTEVAL中所有的网络犯罪攻击,并且通过对108,637笔历史交易的重放验证,充分证明了这些不变量的正确性与可靠性。大规模实验清晰展示了智能合约不变量在抵御网络犯罪分子方面的强大能力。该研究为智能合约安全提供了一种新的防御思路,并为自动化不变量生成工具的未来发展奠定了评估基础。适合智能合约安全研究人员、区块链安全工程师以及形式化验证领域的学者阅读。
💡 推荐理由: 该研究首次系统验证了经典不变量概念在真实智能合约攻击场景中的防护效果,为合约审计提供了除漏洞扫描之外的可靠防御手段,并为自动化安全工具研发提供了基准。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Meng Xu
这篇研究报告探讨了在智能合约(如 Diem 支付网络)中推广形式化验证时,开发人员对“规范(specifications)”角色的不同理解如何影响形式化验证的整体效果。作者指出,初次接触形式化验证的软件开发者,往往对规范在操作层面上的意义持有微妙但不同的解释,这些解释会直接影响他们编写的规范类型,进而导致保证效果碎片化,削弱验证工作的整体效力。论文基于在一个金融敏感的智能合约环境中部署形式化验证系统的实际经验,总结了工业界资深开发者(但对形式化方法尚属新手)中常见的三种观点:1)规范是与最终用户沟通的实现与功能之间的契约;2)规范是类型系统的扩展;3)规范是高层状态机的定义。作者认为,虽然哪种解释更接近规范的真正目的尚无定论,但一个重要区分被忽略了:某些规范是“抽象规范(abstracting specs)”,用于锁定需求或意图,因此越多越好;另一些规范是“证明辅助(proof assistance)”,旨在促进实现与抽象规范之间的精化证明,因此应仅在需要时编写;还有一些规范是“指称规范(denotational specs)”,从形式化方法角度看并不增加额外的保证。若缺乏这一区分,形式化验证很容易陷入“规范累积但整体保证并未增加”的陷阱。论文作为一种经验报告,核心贡献在于提出应当明确区分不同类型的规范,并强调抽象规范在保证整体验证有效性中的关键作用。适合正在或计划在智能合约、区块链或高安全性系统中引入形式化验证的团队阅读,尤其对安全工程师和验证工程师具有实践指导意义。
💡 推荐理由: 形式化验证在安全关键系统中日益重要,但规范编写方式直接影响验证效果。本论文揭示的规范分类问题可帮助蓝队和安全工程师评估智能合约等场景下验证结果的可信度,避免“虚假保证”。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ethan Cecchetti, Siqiu Yao, Haobin Ni, Andrew C. Myers
该论文聚焦于智能合约等可重入应用(Reentrant Applications)的组合安全(Compositional Security)问题。智能合约中反复出现的灾难性漏洞(如著名的重入攻击)表明,在编写需要与恶意代码组合运行的软件时,我们尚缺乏可靠的构造安全代码的方法。信息流控制(Information Flow Control, IFC)长期以来被视为实现组合安全的有效途径,能够在组合来自不同信任域的软件时提供强安全保证。然而,当存在重入(reentrancy)攻击时,传统信息流控制的理论保证会被破坏,使得这一方案在现实中难以奏效。论文的主要贡献包括:第一,形式化定义了通用意义上的重入概念,厘清了何种行为构成重入;第二,提出一种新的安全条件,允许智能合约等软件模块在保留安全重入形式表达力的同时,保护其关键不变量;第三,设计并实现了一个安全类型系统,该类型系统可证明地执行安全信息流策略;第四,将类型系统与运行时机制相结合,使得在存在未知恶意代码的情况下,依然能够强制实施安全的重入约束;第五,通过该类型系统成功定位并修正了若干近期备受关注的高危漏洞实例。实验评估表明,该方法既保持了实用性,又显著提升了组合安全性。该研究为构建抗重入的智能合约及类似可重入应用提供了形式化基础与工具支撑,适合安全编程语言研究者、智能合约开发者以及系统安全工程师阅读。
💡 推荐理由: 该研究直接回应了智能合约高频重入漏洞的根源,为组合恶意代码场景下的安全保证提供了形式化验证途径,可显著降低此类漏洞的实盘风险。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Xiaocan Wang, Shixuan Guan, Tong Yang, Xiapu Luo, Yue Duan, Kai Li
本文首次系统性地研究了交易模拟钓鱼(Transaction Simulation Phishing)这一新型攻击方式。加密货币钱包(如 MetaMask)的交易模拟功能能够在链上执行前预览余额变化,以帮助用户识别恶意交易。然而,攻击者利用动态区块链状态依赖的智能合约,让模拟结果呈现良性或高收益假象,而真实链上执行却将用户资金转移到攻击者地址。作者首先提出了一套用于构建此类钓鱼合约的分类法,然后设计并实现了 SIMGUARD,一种在字节码层面结合静态与动态分析的检测系统。SIMGUARD 通过识别合约中对动态状态(如区块信息、时间戳、调用深度等)的条件分支,以及模拟与真实执行间的差异,来标记可疑合约。在以太坊、币安智能链、Avalanche 和 Polygon 四条链上,作者从2024年8月至2025年6月间检测出超过4000个钓鱼合约,涉及超过5700名受害者,累计损失约348万美元,其中91.5%发生在以太坊上。聚类分析显示,最大的钓鱼合约集群贡献了约83%的损失。实验结果揭示了当前钱包防御机制的严重缺陷,证明了现有交易模拟在面对此类攻击时的不可靠性,并强调了开发更稳健模拟机制(如使用真实执行环境或引入不依赖单点模拟的验证协议)的紧迫性。该研究为区块链安全社区提供了新的攻击面认知、检测工具和防御改进方向,对钱包开发者、安全审计人员和区块链安全研究者均具有重要参考价值。
💡 推荐理由: 暴露了主流钱包交易模拟功能的可欺骗性,攻击者可绕过该防御直接盗取资金,迫使安全社区重新审视交易模拟的信任边界,并推动部署更可靠的检测机制。
🎯 建议动作: 研究跟进并评估在内部安全产品中集成 SIMGUARD 的可行性,同时推动钱包侧交易模拟机制的加固。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Vabuk Pahari, Balakrishnan Chandrasekaran, Johnnatan Messias, Krishna P. Gummadi, Abhisek Dash
本文研究去中心化自治组织(DAO)中治理权力的行使机制及其安全影响。DAO 是一种通过智能合约管理区块链协议的治理实体,其治理合约明确规定了利益相关者如何提出、表决和执行协议变更。作者指出,治理合约的设计选择对 DAO 及其管理的智能合约的安全性和隐私性具有深远影响,不当设计可能引入关键漏洞。论文首先阐述了实现 DAO 时设计选择带来的信任与透明度权衡;其次,通过真实案例强调了糟糕的设计选择如何导致严重漏洞。为此,作者分析了 48 个公开且活跃的基于以太坊的 DAO,这些 DAO 控制着大量资本。他们将设计选择分类为几个关键维度,简洁地描述了 DAO 利益相关者如何发起协议变更、投票以及根据投票结果执行变更。分析揭示了一类新型攻击——治理攻击,这类攻击直接利用 DAO 治理机制的基本设计缺陷,即使智能合约实现无 bug 也无法避免。文章的核心贡献在于系统化地分类 DAO 治理设计选择,并提出治理攻击的概念,为 DAO 安全研究提供了新视角。适合区块链安全研究者、DAO 开发者和智能合约审计人员阅读。
💡 推荐理由: DAO 管理着巨额资本,治理机制的设计缺陷可导致直接的资金损失或治理权被篡夺。本文首次系统化提出治理攻击类别,对蓝队评估 DAO 安全性和设计稳健治理机制具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Liyi Zhou, Kaihua Qin
本文是DeFi '24研讨会的会议报告,聚焦于去中心化金融(DeFi)及其安全性问题。研讨会汇集了学术界和工业界的研究人员,旨在探讨DeFi生态系统中的新兴安全威胁、漏洞模式、攻击案例以及防御机制。主要讨论主题包括:智能合约漏洞(如重入攻击、闪电贷攻击、预言机操纵)、经济安全(如MEV、套利策略)、跨链桥风险、以及去中心化治理安全。此外,还涉及了形式化验证、运行时监控和异常检测等安全分析技术。会议强调了DeFi安全面临的独特挑战,例如代码不可变性与经济激励的复杂交互。该报告为DeFi安全社区提供了当前研究方向和关键问题的全面概述。
💡 推荐理由: DeFi协议管理着数百亿美元资产,但其安全事件频发。该研讨会总结了前沿攻击面与防御思路,对蓝队评估DeFi风险、理解新兴威胁有直接参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Qiyang Song, Heqing Huang 0001, Xiaoqi Jia, Yuanbo Xie, Jiahao Cao 0001
以太坊智能合约的重入漏洞曾导致巨大的经济损失,为此社区开发了多种自动化重入检测器。然而,这些检测器因检测规则过于粗糙而频繁产生大量误报,常将已采用防重入模式(如互斥锁、检查-生效-交互模式等)保护的合约误判为存在漏洞。现有代码分析技术在识别这些防重入模式时面临挑战,主要原因是防重入模式的特征复杂且多样,且缺乏对这些特征的先验知识。本文提出 AutoAR,一个自动化识别系统,用于探索和识别以太坊合约中普遍存在的防重入模式。AutoAR 利用一种专门的图表示 RentPDG(Reentrancy Protection Dependency Graph),结合数据过滤方法,从大量合约中有效捕获与防重入相关的语义信息。基于从合约中提取的 RentPDG,AutoAR 采用一个集成图自编码器与聚类技术的识别模型,专门用于精确识别防重入模式。实验结果表明,AutoAR 能够帮助现有检测器识别 12 种常见的防重入模式,准确率达到 89%;将其集成到检测流程后,误报率降低了超过 85%。该工作为提升智能合约安全检测的准确性提供了有力工具。
💡 推荐理由: 当前重入检测器误报率高,阻碍了自动化审计的落地。AutoAR 能精确识别防重入模式,大幅减少误报,提升智能合约安全分析效率。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Rui Cao, Shaojing Fan, Zhimei Sui, Liming Fang, Ziqi Yang, Yingying Jiao, Zhenguang Liu
该论文提出了 DeFiScreener,一种基于历史攻击案例匹配的高效 DeFi 攻击预筛查框架。背景:截至 2026 年 1 月,已有超过 5,200 个 DeFi 项目部署在主流区块链上,但现有检测工具通常仅覆盖特定攻击类型,检测覆盖范围严重不足。核心观察:作者发现一种称为“危险时间不对称”的现象,即攻击者在时间上倾向于利用某些特定函数调用模式。基于此,DeFiScreener 通过以下步骤实现预筛查:首先,从目标项目的完整源代码中构建函数调用树(FCT),并使用大语言模型(LLM)为每个函数生成语义嵌入,融合程序结构和函数意图。然后,实施双层筛查:函数层将函数嵌入与历史攻击函数库中的攻击模式进行匹配;序列层利用提出的基于攻击模式的蒙特卡洛树搜索(APO-MCTS)高效探索 FCT,筛选出易受攻击的调用序列。最后,将候选结果传送给 LLM 进行进一步解释和安全分析。实验基于 207 个真实世界 DeFi 攻击事件的数据集,结果显示 DeFiScreener 在攻击预筛查中达到了 98.55% 的召回率和 84.30% 的精确率。该方法显著扩展了检测覆盖范围,为 DeFi 智能合约的自动化安全审计提供了新的思路。
💡 推荐理由: DeFiScreener 开创性地利用历史攻击案例进行预筛查,大幅提升了检测覆盖率和效率,对蓝队评估智能合约风险、发现未知攻击模式具有重要参考价值。
🎯 建议动作: 研究跟进,评估工具可用性及其在内部审计流水线中的集成潜力。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Deyu Yang, Rundong Wei, Xiaoqi Li
该论文针对以太坊非同质化代币(NFT)智能合约中的漏洞检测问题,提出了一种结合漏洞导向代码切片、ERC-721 知识库和受限大语言模型(DeepSeek)分析的方法。研究背景是:现有静态分析工具(如 Slither、Mythril)基于规则高效,但难以处理特定应用逻辑;而自由形式的大模型分析可能被无关代码干扰或输出不一致。作者通过正则表达式模式定位重入、整数溢出/下溢和时间戳依赖等漏洞的候选语句,利用结构感知的上下文窗口算法提取带行号的代码切片,然后让 DeepSeek 基于显式决策规则和固定输出模式分析每个切片,最后支持自动批量处理。在 450 个 NFT 合约样本上,完整配置产生了 437 个阳性标签(阳性率 97.1%);去除外部知识库后阳性率降至 87.11%;分析完整合约(无知识库)则降至 73.78%。实验表明,聚焦的代码上下文和领域约束显著影响检测器的输出效果。该方法为智能合约漏洞检测提供了一种结合专家知识与大模型能力的新范式,适用于安全审计人员和研究机构。
💡 推荐理由: 针对 NFT 智能合约的专用漏洞检测方法,利用代码切片减少大模型分析噪声,结合 ERC-721 知识库提升准确率,为蓝队审计数字资产合约提供可落地的辅助工具。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hongyin Chen, Yubin Ke, Xiaotie Deng, Ittay Eyal
该论文研究了区块链智能合约中依赖外部报告的问题。现有机制在安全性与性能之间存在权衡:依赖少量受信报告者会引入中心化风险,而允许开放报告则导致链上报告数量过多。作者指出,根本原因在于对称奖励设计,即对所有报告一视同仁。论文证明,任何对称奖励机制都无法克服这一权衡。为此,他们提出了 Prrr(Personal Random Rewards for Reporting)协议,该协议为报告分配随机的、非统一的奖励值,引入了一种新型机制设计概念——事前合成不对称性(Ex-Ante Synthetic Asymmetry)。据作者所知,Prrr 是第一个有意构建参与者不对称性的博弈论机制(在任何领域中)。Prrr 采用类似第二价格拍卖的结算方式分配奖励,确保激励兼容性,并同时实现安全性和效率。遵循该协议构成子博弈完美纳什均衡,能够抵御合谋和女巫攻击。Prrr 适用于众多依赖及时报告的智能合约。
💡 推荐理由: 提出了一种全新的机制设计思路,通过故意引入奖励不对称性,打破了区块链报告机制中安全与效率的固有矛盾,对去中心化预言机和链上数据报告场景具有重要理论价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sanjam Garg, Aarushi Goel, Dimitris Kolonelos, Rohit Sinha 0001
本文提出Jigsaw系统,旨在实现双重隐私保护的智能合约,即同时保护合约的输入数据和合约逻辑(代码)的隐私。传统的智能合约在区块链上公开执行,导致交易数据和合约代码对所有节点可见,存在隐私泄露风险。Jigsaw结合了安全多方计算(MPC)和零知识证明(ZKP)等密码学技术,设计了一种新的协议,允许合约参与方在不泄露各自输入和合约逻辑的情况下协同执行计算,并验证结果的正确性。系统架构采用分片(sharding)和秘密共享机制,将合约状态分割成多个秘密份额,分布在不同节点上,任何单个节点无法获取完整信息。实验评估表明,Jigsaw在以太坊测试网络上运行具有可接受的性能开销,相比现有完全同态加密或MPC方案,在延迟和吞吐量方面有所优化。本文的主要贡献在于提出了首个同时满足输入和代码隐私的智能合约系统,并给出了形式化安全证明和原型实现,为区块链隐私保护研究提供了新的方向。
💡 推荐理由: 智能合约的隐私保护是区块链大规模应用的关键瓶颈。Jigsaw同时保护输入和代码,可拓展至金融、医疗等敏感数据场景,降低合规风险。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xianhao Zhang, Jing Sun, Zijian Zhang, Ye Liu, Zhe Hou, Jiaqi Gao, Yuqiang Sun
本文提出了一种名为 KASS(知识增强攻击合成与仿真)的多智能体框架,旨在解决现有智能合约安全工具仅停留在漏洞检测、无法验证漏洞可利用性及攻击过程的问题。KASS 将自动利用生成分解为规划、生成和测试三个阶段,并融合三种互补机制:基于检索增强的现实审计知识规划、将攻击计划绑定到可执行概念验证测试的形式化生成与验证约束,以及修复代码级错误并在攻击假设失败时触发策略级重规划的分层双循环优化过程。评估在包含 104 个合约的 SmartBugs-Curated 数据集上进行,涵盖四种漏洞类型。结果显示,KASS 对 94.23% 的测试合约成功生成了可执行利用,该比率高于先前 REX 和 AdvSCanner 在类似子集上的报道结果,也高于同等评估协议下复现的 Claude Code 基线。在 11 个真实世界 CVE 标记合约上,KASS 成功验证了 9 例。除生成利用外,KASS 还输出结构化攻击计划,记录利用流程、量化潜在资产损失,并可作为静态分析工具的语义误报过滤器。该工作为蓝队和审计人员提供了自动化验证漏洞可利用性的能力,有助于区分真实威胁与误报。
💡 推荐理由: 该框架将智能合约安全从被动检测推进到主动可利用验证,可帮助防御者聚焦真正可被利用的漏洞,减少误报噪音并评估实际资产损失风险。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Tommaso Frassetto, Patrick Jauernig, David Koisser, David Kretzler, Benjamin Schlosser, Sebastian Faust, Ahmad-Reza Sadeghi
传统智能合约在区块链上执行的成本高昂,尤其是在以太坊等平台上,随着费用飙升,复杂应用变得不切实际。链下执行是一种有前景的解决方案,但现有方案存在诸多缺陷,如昂贵的区块链交互、缺乏数据隐私、资本成本高(因需要锁定抵押品)或仅支持有限的应用场景。本文提出了一种实用的链下智能合约执行协议POSE(Practical Off-chain Smart Contract Execution),通过利用可信执行环境(TEE)池高效执行计算,并能够快速从意外或恶意故障中恢复。POSE提供了强大的安全保证,即使大量参与方被攻破也能保持安全性。作者对概念验证实现进行了效率和有效性评估。该协议适用于需要高吞吐量、低成本和隐私保护的智能合约应用场景,如金融产品、拍卖和游戏等。
💡 推荐理由: POSE针对现有链下执行方案的痛点,利用TEE实现了高效、低成本和隐私保护的智能合约执行,对推动去中心化应用落地具有实际意义。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bhargava Shastry
该论文针对以太坊上最流行的智能合约编译器——Solidity编译器中的误编译漏洞(miscompilation bugs)进行了系统性的发现与分析。智能合约编译器的正确性对于保证区块链上不可篡改的开源代码的正确执行至关重要。作者开发了SolSmith,一种语义感知的差分模糊测试工具,在三年内持续检测Solidity编译器,发现了25个未被发现的误编译漏洞,其中一些已存在多年。SolSmith通过生成有效的测试程序,压力测试编译器的代码生成和优化组件,从而发现常规测试无法捕获的缺陷。论文的贡献包括:1)使编译器测试更加严格,减少因编译器错误导致的智能合约缺陷;2)对发现的误编译漏洞进行了定性和定量分析,按其性质、根本原因和最终用户影响进行分类,揭示了优化编译器的一些常见陷阱。该研究对于提升Solidity编译器的可靠性和安全性具有重要意义。
💡 推荐理由: 编译器缺陷会导致智能合约执行错误,由于区块链代码不可篡改,可能造成严重的经济损失。本研究系统性地发现并分类了Solidity编译器中的误编译漏洞,为编译器开发者和智能合约开发者提供了关键参考。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: James Austgen, Dani Vilardell, Ari Juels
本文提出了 Crossroads,一个用于链抽象资产的智能合约层。在 Crossroads 中,来自几乎所有链的资产都在单个后端区块链上以 ERC-20 代币的形式表示。因此,任何资产都可以在单一统一平台上参与基于智能合约的交换、借贷或隐私应用。虽然 Crossroads 提供了跨链桥接功能,这是当前缓解区块链生态系统碎片化的一种常见部分方法,但这只是 Crossroads 通用链抽象模型中的一项服务。Crossroads 依赖于密钥加密:一个门限签名委员会持有加密密钥,控制着每个集成链上的资产,仅在后端区块链上的智能合约授权时才签署交易。资产移动具有费用效率,因为所有权变更记录在后端区块链上,用户可以为提款设置交易费用。Crossroads 使用可插拔的预言机(zkBridge、基于 TEE 的、混合的)实现了新区块链的无许可、模块化集成,并具有灵活的设计选项。存入 Crossroads 的资产受益于强大的、特定链的最终性保证,最大限度地降低了重组攻击的风险。然而,与现有桥接器不同,Crossroads 中的第三方智能合约可以在最终性完成之前提供快速的乐观资产访问。作者证明了 Crossroads 满足可靠性:给定一个诚实的签名委员会成员法定人数,任何用户都可以单方面生成一笔提款交易,将其净余额转移到集成链上的一个账户。作者在多个公共区块链(比特币、以太坊和 Solana)上实现了概念验证。他们还列举了 Crossroads 支持的一系列应用,包括通用钱包、跨链质押和借贷、隐私保护支付以及公共区块链资产的私有管理。
💡 推荐理由: Crossroads 提出了一种新颖的链抽象方案,通过智能合约和门限签名委员会统一管理跨链资产,解决了区块链碎片化问题,同时保持了去中心化信任和可组合性。对于关注跨链互操作性和 DeFi 安全的研究者具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Yuqiang Sun, Han Liu, Ying Li, Yiran Zhang, Zong Cao, Ziyun Guo, Yang Liu
该论文提出 EvoVuln,一个自动生成智能合约漏洞检测程序化知识的框架。现有基于大语言模型(LLM)的方法存在局限:基于提示的方法依赖人工设计的检测规则,而微调则需要大量标注样本,这在智能合约领域难以获取。EvoVuln 将漏洞检测重新定义为程序化知识进化问题,仅需极少量标注样本即可合成并精炼检测逻辑。其核心机制包括两个部分:一是运行时反转控制(IoC)架构,将检测规则编译为可执行策略,严格解耦确定性控制流与 LLM 语义推理,确保忠实遵循逻辑并产生密集的诊断遥测用于精确定位错误;二是两阶段进化流水线,通过溯因语义调试在没有参数更新的情况下精炼规则:冷启动阶段利用自动生成的边缘案例初始化并压力测试初始规则,少样本进化阶段仅使用每种漏洞类型 5 个漏洞样本和 5 个安全样本将策略锚定到真实世界语义。在五种真实漏洞类型上的评估显示,EvoVuln 达到 71% 的宏平均 F1 分数,优于所有基线。进化得到的程序化知识可跨模型迁移:使轻量低成本模型超过更大的零样本模型 19 个百分点,且无需重新训练即可迁移到其他 LLM,单次进化成本低于 50 美元。该研究适合安全研究员、智能合约开发者及 LLM 应用开发者阅读。
💡 推荐理由: 提出一种低成本、高可迁移的智能合约漏洞检测方法,突破 LLM 依赖大量标注数据的瓶颈,且知识可跨模型复用,为自动化漏洞检测提供了新范式。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jens-Rene Giesen, Christian Scholz, Lucas Davi
该论文提出了一种基于语料库驱动的以太坊智能合约反编译方法,名为Code HarvETHter。反编译是以太坊安全分析的关键步骤,因为智能合约通常以字节码形式部署,难以直接分析。现有的反编译工具往往依赖于静态规则或模式匹配,存在精度低、可移植性差等问题。本文的创新点在于利用大规模智能合约字节码语料库来训练或指导反编译过程,从而自动学习字节码与高级语言结构之间的映射关系。该方法首先从公开的区块链数据集中收集大量已验证的智能合约字节码及其对应的源代码(如有),构建配对语料库。然后,设计了一种基于序列到序列学习的神经网络模型(或类似方法),将字节码序列映射为伪源代码。此外,论文还探讨了如何利用控制流和数据流分析来增强反编译结果的语义正确性,例如识别函数边界、变量类型和数据结构。通过在一个包含2000多个真实以太坊智能合约的数据集上进行实验,与现有工具(如Porosity、Vandal、Rattle)相比,Code HarvETHter在函数识别准确率、类型恢复和反编译代码的可读性方面均有显著提升。该研究对于智能合约安全审计、漏洞检测以及恶意合约分析具有潜在价值。
💡 推荐理由: 以太坊智能合约安全事件频发,而反编译是理解恶意或闭源合约的关键。现有反编译工具准确率不足,该论文提出的数据驱动方法有望大幅提升反编译质量,助力安全分析师快速定位漏洞。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.4)
👥 作者: Sally Junsong Wang, Kexin Pei, Junfeng Yang
智能合约是区块链上执行各种商业活动的软件程序。近年研究发现了一类新的“机器不可审计”漏洞,它们源于源代码未能满足底层交易上下文。现有检测方法需要人工理解交易逻辑并手动推理不同上下文来源(即模态),例如代码和描述预期交易行为的自然语言。为了自动化检测这类漏洞,本文提出了SmartInv,一个准确且高效的智能合约不变量推断框架。核心洞见在于,智能合约的预期行为(通过不变量指定)依赖于跨模态信息的理解和推理,如源代码和自然语言。作者提出了一种新的基础模型微调和提示策略——Tier of Thought (ToT),用于在智能合约的多个模态间进行推理并生成不变量。SmartInv随后通过检查这些生成不变量的违反情况来定位潜在漏洞。实验评估基于过去2.5年(2021年1月1日至2023年5月31日)导致财务损失的真实世界智能合约漏洞,结果表明SmartInv能生成有效不变量,准确定位“机器不可审计”漏洞,共发现119个零日漏洞。从中采样了8个漏洞报告给相应开发者,其中6个被迅速修复,5个被确认为“高严重性”。该研究展示了利用多模态大模型自动推理智能合约安全性的可行性和有效性。
💡 推荐理由: 该研究提出了一种自动化检测智能合约中新型“机器不可审计”漏洞的方法,填补了现有工具依赖人工的空白,对提升区块链应用安全性具有实用价值。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Jintao Huang, Fengqing Jiang, Radha Poovendran, Zhiqiang Lin
该论文提出了CyberChainBench,一个用于评估基于大型语言模型(LLM)的智能合约安全代理的基准测试。基准测试涵盖三个互补任务:漏洞检测、利用生成和补丁合成。它基于来自DeFiHackLabs的541个真实世界利用事件构建,跨越9个EVM兼容链。每个案例锚定到特定区块,包含结构化真实数据(漏洞类型、定位、攻击者利润)。代理通过Harbor编排的隔离评估环境与历史区块链状态交互,使用工具读取代码、追踪交易并在主网分叉上验证利用。利用按历史分叉上的经济影响分级;补丁通过在可代理升级的子集上重放历史攻击和合法交易作为失败测试预言机进行验证。论文定义了五类漏洞分类法,并评估了多种代理-模型配置。结果显示明显难度梯度:最佳配置在检测上得分37.5%,利用上43.7%,但补丁上仅23.4%。顶级代理(Codex with GPT-5.5)在200个利用案例中实现总计5740万美元的利用利润,每个案例成本2.39美元。该基准为智能合约安全研究提供了标准化评估平台,揭示了当前LLM代理在自动化安全任务中的能力与局限。适合安全研究员、智能合约开发者和AI安全交叉领域从业者阅读。
💡 推荐理由: 首个端到端评估LLM代理在智能合约安全上真实世界利用的攻击-防御能力的基准,揭示了当前AI代理在自动补丁生成上的显著短板,为后续研究提供了明确方向和数据基础。
🎯 建议动作: 研究跟进,评估自身智能合约安全流程中引入AI代理的可行性及局限。
排序因子: 有可用补丁/修复方案 (+3) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Samuel Steffen, Benjamin Bichsel, Martin T. Vechev
本文提出Zapper,一个旨在为智能合约提供数据和身份隐私保护的系统。在区块链环境中,智能合约的执行数据通常对所有节点公开,这导致敏感信息(如交易金额、用户身份)面临泄露风险。Zapper通过集成先进的密码学技术(如零知识证明、同态加密或安全多方计算),实现合约状态的加密存储与计算,同时允许验证者在不泄露具体数据的情况下确认合约的正确执行。此外,Zapper还支持匿名认证机制,隐藏交易参与方的身份,从而增强用户隐私。该工作可能设计了一套新的编程模型或编译器,使开发者能够便捷地编写隐私保护智能合约,并在以太坊等平台上部署。实验评估可能展示了其在计算开销、交易成本和可扩展性方面的权衡。该研究对区块链隐私保护领域具有重要参考价值,尤其适用于金融、供应链和身份管理等对隐私敏感的应用场景。
💡 推荐理由: 智能合约的透明性虽是优势却也带来隐私风险,Zapper直接解决这一矛盾,为合规要求(如GDPR)下的区块链应用提供技术基础,值得安全从业者关注。
🎯 建议动作: 研究跟进
排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xiaoting Zhang, Zhipeng Gao, Yiran Lv, Xing Hu, Feifei Niu, Xin Xia
该论文提出了 GiANT 自动化框架,旨在解决智能合约审计数据集构建中的人工可扩展性瓶颈以及数据粒度和多样性不足的问题。GiANT 采用分治策略结合思维链技术,从 Code4rena 平台上的真实审计报告中提取结构化漏洞信息,并通过 LLM 作为裁判机制进行严格的质量保证。研究者在 388 份真实审计报告上运行 GiANT,生成了包含 7,711 个漏洞发现、覆盖五个严重级别的 GiAnt Corpus 数据集。手动评估显示信息提取可靠性极高,平均质量得分 4.76/5,评分者间一致性 κ=0.88。进一步,他们使用该数据集对四个最先进的 LLM 在漏洞检测、代码摘要、缓解建议和自动 Gas 优化任务上进行基准测试,建立了性能基线,为自动化智能合约审计的未来研究提供了宝贵的数据基础。
💡 推荐理由: 该工作提供了一个高质量、大规模、多粒度的智能合约审计数据集,有助于推动自动化审计工具和大型语言模型在区块链安全领域的研究与评估。
🎯 建议动作: 研究跟进,考虑将该数据集纳入智能合约安全工具的评估基准。
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Gabriela Dobrita, Simona-Vasilica Oprea, Adela Bara
现有的基于学习的Solidity智能合约漏洞检测器通常将检测简化为单函数内的语法模式匹配,但许多重大利用(如The DAO、Cream Finance)并不存在于单个函数中,而是存在于函数间的关系以及使攻击可行的条件组合之中。为此,本文提出AttackPathGNN,一种将检测重新定义为对显式攻击路径推理的图神经网络(GNN)。其两个架构创新区别于先前的GNN检测器:(1)状态干扰图(State Interference Graph),该图通过带类型和权重的边以及由显式五条件谓词定义的有向重入路径边,连接共享可变存储的每对函数;(2)合取池化(conjunction pooling),一种对八个命名利用前提条件的可微AND聚合器,其log-sigmoid形式使得当任一缓解措施(如重入守卫、访问控制修饰符或SafeMath)到位时,每个函数的利用评分会骤降。在五个独立训练运行中,AttackPathGNN在SmartBugs Wild保留测试集上达到92.3±0.2%的F1分数(假阴性率4.3±0.3%,在独立人工标注的SmartBugs Curated基准上检测率90.8±2.5%),并在每个种子上以100%恢复6/10个DASP10类别,重入检测达到98.7±1.8%。每次预测都附带结构化的修复报告,将每个判定转化为可操作的、函数级别的审计发现。该研究对智能合约安全审计、自动化漏洞检测工具开发具有重要参考价值。
💡 推荐理由: 该研究创新性地将漏洞检测从单函数模式匹配提升到跨函数攻击路径推理,显著降低了假阴性率,并提供了可解释的修复建议,对提升智能合约审计的自动化水平和准确率有实际价值。
🎯 建议动作: 研究跟进并考虑将方法集成到内部智能合约审计流程中。
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Wan-Hsuan Hsu, Wei-Hsin Wang, Cheng-Yu Liou, Ting-Rui Ke, Kentaroh Toyoda
该论文提出了Bastet,一个面向去中心化金融(DeFi)智能合约漏洞检测的细粒度专家标注数据集。2024年,DeFi协议因智能合约漏洞累计损失超过14.9亿美元,基于大语言模型(LLM)的漏洞检测成为有前景的应对方案,但现有评估数据集存在三大问题:基于过时的Solidity版本(如v0.4),无法反映现代DeFi合约;依赖自动化或LLM生成的标注,引入幻觉导致的标签噪声;采用粗粒度的单层标签,难以捕获真实业务逻辑漏洞的语义复杂性。Bastet通过以下方式解决这些问题:数据来源为2021-2024年的真实审计发现;由人类专家通过讨论达成共识进行标注;采用两层分类体系,包含46个标签和77个子标签。数据集包含从394份Code4rena竞争性审计报告中收集的4,402个发现(时间跨度为2021年4月至2024年11月),其中849个发现由DeFiHackLabs社区的白帽安全研究人员完全标注。所有标注均通过双标注者共识工作流程生成,确保了基于真实漏洞根因的标签准确性。该数据集的主要贡献在于:提供高质量、精细化的基准,以推动LLM在DeFi安全领域的应用研究,并促进可复现的实验评估。适合智能合约安全研究人员、LLM应用开发者及DeFi协议审计人员阅读。
💡 推荐理由: 现有漏洞检测数据集质量低下,限制了LLM模型的实际效果。Bastet通过专家标注和精细分类,为DeFi智能合约漏洞检测提供了可靠基准,有望显著提升自动化审计的准确性和实用性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Bagus Rakadyanto Oktavianto Putra, Muhamad Risqi Utama Saputra, Widyawan, Guntur Dharma Putra
该论文提出了一种轻量级的智能合约安全审计框架,利用经过蒸馏和聚合的开放源码大语言模型(LLM)来应对现有基于LLM的审计方法存在的计算开销大、缺乏严重性评估以及可操作修复建议等问题。框架将审计任务解耦为四个独立模块:漏洞检测、漏洞解释、严重性分类和修复建议。通过采用秩稳定低秩适配器(rsLoRA)、知识蒸馏以及定制的链式验证(CoVe)聚合策略,模型在保持高精度的同时显著降低了参数量(0.6B-4B参数)。实验表明,该轻量级流水线在漏洞检测上达到98.25%的准确率,在生成解释任务中对齐得分为0.4375,优于参数量7B-34B的密集编码器LLM。消融实验验证了解耦审计流程相比统一提示的优势,并发现了新颖的严重性中心偏差,为未来LLM辅助审计研究建立了基准。
💡 推荐理由: 该研究展示了如何利用轻量级模型在不牺牲性能的情况下实现高效的智能合约审计,为资源受限的团队提供了可行的自动化安全审计方案。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ahto Buldas, Dirk Draheim, Mike Gault, Risto Laanoja, Vladimir Rogojin, Ahto Truu
该论文提出了一种名为 Unicity 的代币所有权模型的泛化版本,将传统简单的所有权条件扩展为可编程的支出条件,称为“谓词”(predicates)。这些谓词允许在链下执行类似智能合约的功能,而无需共识参与者(如矿工或验证者)直接执行,而是由依赖方(如交易接收者)自行验证。作者证明,Unicity 执行层的安全属性可以归约到谓词族不可伪造性(predicate family unforgeability),从而保证了在添加可编程条件后,系统的安全基础不受损害。为了展示该模型的实用性,论文详细描述了如何利用谓词实现无信任的原子交换(atomic swap),即两个互不信任的参与方在不依赖第三方中介的情况下安全交换代币。原子交换的实现通过构建特定的谓词条件,使得交易要么全部执行,要么全部回滚,避免了部分执行的风险。该研究为区块链和去中心化金融领域提供了一种新的链下智能合约范式,降低了链上计算和存储开销,同时保留了安全保证。
💡 推荐理由: 该研究提出了一种链下可编程支出条件的安全模型,为去中心化金融中的原子交换等场景提供了更高效、无需信任的解决方案。安全从业者应关注其归约证明方法,以确保类似系统的安全性分析。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ray Iskander
本文提出了首个经过机器检查的OpenZeppelin重入防护模式正确性证明,该证明针对生产部署的Solidity源代码的Lean 4状态机模型。所有十三个定理都经过了机器检查,没有使用任何“sorry”或用户引入的公理,公理足迹仅由[propext](一个标准的mathlib4公理)限定,并集成在持续集成中。智能合约重入攻击自2016年以来已导致超过5亿美元的损失,其中DAO 2016攻击盗取了约360万ETH,并迫使以太坊硬分叉。OpenZeppelin ReentrancyGuard模式是生产DeFi中的事实标准防御措施,但此前没有工作建立其判别能力:即该防护能阻止对易受攻击实例的攻击,保持非攻击交易的正确执行,并区分相邻的安全和易受攻击变体。以往的工作要么形式化了玩具合约上的防护正确性,要么形式化了孤立实例上的攻击可行性,但未同时涵盖两个方向及针对生产源码的边界情况。本文通过变异测试验证了三种生产实例:DAO 2016、Compound v2和Aave V3的flashLoan,以及Aave V3 flashLoan的一个最小差异突变体(flashLoanVulnerable),该突变体隔离了一个安全关键差异。三方向结构包括:(a) DAO 2016模式的攻击复现,(b) Compound v2的正确性证明,(c) 区分Aave V3符合CEI模式的flashLoan与突变体的边界案例证明。一个顶层的元定理在“无改造”原则下组合了这三个方向,并在首次跨协议压力测试(从Compound v2到Aave V3)中进行了演示;更广泛的家族可移植性是未来工作。完整的Lean 4源码、CI配置和复现命令可在GitHub上获取。
💡 推荐理由: 首次对生产级DeFi合约的重入防护进行机器检查的形式化验证,提供了高可靠性的安全保证,为智能合约安全审计和形式化验证方法学树立了新标杆。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Kaihua Qin, Dawn Song, Arthur Gervais
智能合约反编译旨在从字节码恢复高级语言源代码,但现有评估方法存在数据集狭窄、指标不一致、语义一致性检查有限等问题。随着大型语言模型(LLMs)开始生成看似合理但语义可能偏离原始合约的Solidity代码,这一问题变得日益重要。本文提出SCDBench,一个基于LLM的智能合约反编译器数据集和评估基准。数据集包含600个真实Solidity合约,配有其字节码输入、真实源代码和可重放的语义检查点。SCDBench通过四个递进阶段评估反编译输出:格式完整性、可编译性、应用程序二进制接口(ABI)恢复以及通过差分重放实现语义一致性。作者在零样本反编译设置下评估了Claude Opus 4.7、GPT-5.3-Codex和GLM-5(包括有无扩展推理的变体)以及零样本编译修复设置。结果表明,前沿LLM通常能生成结构清晰且可编译的Solidity代码,但实现语义一致性仍远未解决:最佳模型仅完美反编译42/600个合约。进一步实验表明,引入同模型编译修复以适度成本显著提升了性能。SCDBench为严格且可重复的评估建立了共同基础,旨在加速开发用于区块链安全与透明性的可靠智能合约反编译器。
💡 推荐理由: 该研究为评估LLM在智能合约反编译任务中的表现提供了标准化基准,填补了现有评估方法的空白,对区块链安全审计、漏洞检测和合约分析具有重要参考价值。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Stefan-Claudiu Susan, Andrei Arusoaie, Dorel Lucanu
该论文针对基于大型语言模型(LLM)的静态分析在智能合约安全开发中的可靠性和局限性进行了系统基准测试。研究背景是区块链交易的不可逆性使得智能合约漏洞检测成为安全开发的必备环节,而LLM虽被越来越多地集成到开发者工作流中,其作为自主安全审计工具的可靠性尚未得到证实。研究者评估了当前生成模型能否替代传统的静态分析工具,或仅作为其补充。实验发现,LLM的效果受到词汇偏差和缺乏外部数据输入严格验证的削弱,这种对非语义启发式(如标识符命名)的依赖导致高误报率。此外,不同的提示技术在精确率和召回率之间呈现权衡。研究结果基于自定自动化框架得出,该框架在分类模型输出时达到了92%的准确率。论文核心贡献在于量化了LLM在智能合约漏洞检测中的局限性,并提出混合解决方案的可能性。适合安全研究人员、智能合约开发者以及LLM应用开发者阅读。
💡 推荐理由: 揭示了LLM作为智能合约安全审计工具的固有短板,提醒安全从业者不能盲目依赖LLM检测结果,需结合传统静态分析或人工审查。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Xing Zhang, Keyu Zhang, Taohong Zhu, Anbang Ruan
本文提出了一种基于大语言模型(LLM)的智能合约漏洞检测框架。智能合约因其不可篡改特性,易遭受多种安全漏洞攻击,导致重大经济损失。现有检测方法通常依赖人工制定的专家规则,缺乏对不同漏洞类型的灵活适应性。为此,作者构建并公开了一个大规模数据集,包含来自15个主流区块链平台、超过3200个真实项目的31165个专业标注的漏洞实例。该框架利用基于抽象语法树(AST)的精确上下文提取和漏洞特定的提示设计,为13种常见漏洞类型实例化定制检测器。实验结果表明,该方法平均正样本召回率达0.92,平均负样本召回率达0.85,展示了精心设计的上下文提示在实现可扩展、高精度智能合约安全分析方面的潜力。该研究为智能合约安全检测提供了新的思路,特别适合安全研究人员和区块链开发者关注。
💡 推荐理由: 智能合约漏洞频发导致巨额损失,现有检测方法缺乏灵活性。本文利用LLM和大规模数据集实现高召回率检测,有望提升智能合约安全分析的自动化和准确性。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Zijun Feng, Yuming Feng, Yu Wang, Weizhe Zhang, Yuhong Nan, Yuang Liu, Zibin Zheng
本文提出 GoAT-X 框架,旨在解决跨链桥合约安全审计中的语义复杂性问题。跨链桥作为多链生态的关键基础设施,因实现缺陷已造成超过28亿美元损失。现有防御手段如字节码级静态分析难以处理跨链交互的语义复杂度,而基于大语言模型(LLM)的方法虽能理解源代码,但在复杂多合约依赖上容易出现幻觉推理。GoAT-X 将审计过程建模为“审计思维图”(Graph of Auditing Thoughts),模仿人类专家分解、推理和验证安全逻辑的方式。通过将LLM推理锚定在静态提取的数据流上,并将抽象安全属性显式链接到具体代码实现,该框架将语义约束在良定义的结构和状态边界内。在此受限空间中,GoAT-X 将跨链逻辑中的缺失约束和对抗绕过路径作为首要漏洞目标,动态探索推理路径以识别可被利用的语义鸿沟。在涵盖所有已知跨链代币交易攻击的综合基准测试中,GoAT-X 在细粒度审计点上达到92%的召回率,对存在漏洞的项目覆盖率达95%,并在实际场景中识别出117个经确认的风险,且运营成本较低,为可扩展的、逻辑驱动的跨链安全审计建立了新标准。
💡 推荐理由: 跨链桥安全漏洞导致巨额损失,现有自动化审计工具难以应对语义复杂性。GoAT-X首次将LLM推理与静态分析结合,通过结构化思维图实现精准审计,为安全团队提供可落地的规模化审计方案,显著降低漏报。
🎯 建议动作: 研究跟进
排序因子: 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)