本文评估了通用大语言模型(LLM)在破解暗网环境中常见CAPTCHA验证码任务上的有效性。暗网CAPTCHA通常设计为无JavaScript运行,因此与主流验证码系统存在显著差异。研究选取了三种具有代表性的挑战类型:开放圆圈定位、旋转对齐和物体选择CAPTCHA。实验发现,当前多模态大语言模型(MLLM)虽能识别相关视觉结构,但在精确空间定位和几何变换处理上存在系统性缺陷。为缓解这些不足,作者提出两种途径:任务重构或为模型配备专用图像处理工具。最终,他们设计了一个混合框架,将MLLM作为高层推理与编排层,通过模型上下文协议(MCP)将几何计算委托给确定性算法。该框架在全部测试CAPTCHA类型上取得了超过90%的成功率,证明MLLM与经典计算机视觉的互补结合比任一单独方法更准确高效。研究意义在于揭示了MLLM的认知边界,并为类脑混合AI系统提供了设计范式。对安全社区而言,该工作警示CAPTCHA的有效性正面临新威胁,但也为设计更健壮的验证机制提供了参考。
💡 推荐理由: 暗网CAPTCHA是阻止自动化滥用的关键防线,本文展示通用LLM+工具可破解此类防护,提示防御者需重新评估验证码安全性,并探索抗LLM的验证码设计。
🎯 建议动作: 研究跟进