推荐 3.5
Conf: 50%
本文针对日本用户面临的虚假购物网站问题,这些网站通过SEO投毒在搜索引擎结果中排名靠前,造成严重损失。传统收集方法依赖固定关键词,无法跟上不断变化的攻击活动,导致新站点发现延迟。作者提出一种闭环爬虫系统,将虚假网站分类器(fastText+LightGBM)的页面级输出整合到下一周期的搜索查询中。搜索查询通过种子组合策略生成,即从正例页面中提取特征词,并与虚假购物上下文中的种子词(如"deep discount"、"official")结合。为了弥补评估中通常只关注分类器准确率的不足,论文引入了每周期新主机数和累计唯一主机数作为探索范围指标。对比实验显示:固定关键词基线从第2周期起新增主机数为零,完全停滞;而所提方法持续发现新主机,在第3周期时累计唯一主机数平均约为基线的7.6倍。该研究展示了将分类反馈融入爬虫设计以提升对新兴欺诈站点发现能力的有效性。
💡 推荐理由: 该研究解决了传统爬虫在动态攻击下失效的问题,为蓝队和SOC工程师提供了提升钓鱼/欺诈站点发现效率的实用思路。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)