本研究针对现有比特币非法地址数据集的构建方法缺乏可复现性和证据不充分的问题,提出了一种可复现的流水线,用于从地下网络犯罪论坛 HackForums 的十五年历史帖文中提取并验证与非法交易相关的比特币地址。该流水线结合了大型语言模型(LLM)辅助筛选、专家人工审查和链上验证三个环节。首先,利用 LLM 对论坛讨论进行初步筛选,识别可能涉及非法交易的地址;其次,由专家对候选地址进行仔细审查,确认其与特定网络犯罪活动(如勒索、洗钱、非法市场等)的关联;最后,通过区块链数据验证地址的交易行为,确保其确实参与了非法交易。研究团队从 2010 至 2024 年的论坛数据中手动验证了 2,438 个非法比特币地址,并按照十二个网络犯罪类别进行了标注。该数据集与完整的提取流水线一并公开发布,支持其他研究人员对加密货币相关的网络犯罪进行可重复的研究。此工作的核心贡献在于提供了带有上下文证据和链上验证的标签数据集,弥补了现有标签构建过程不透明、证据不足的缺陷。
💡 推荐理由: 该研究提供了首个可复现的、基于论坛证据的非法比特币地址数据集,为追踪加密货币犯罪、评估链上行为提供了可靠标签,有助于安全团队提升对地下经济活动的监测能力。
🎯 建议动作: 研究跟进