#captcha

共收录 8 条相关安全情报。

← 返回所有主题
👥 作者: Guy Frankovits, Lior Yasur, Fred M. Grabovski, Yisroel Mirsky

本文针对实时深度伪造(real-time deepfake)驱动的语音与视频冒充攻击,提出了一套名为 DF-CAPTCHA 的主动防御框架。研究背景是:随着实时换脸与语音克隆模型推理延迟不断降低,攻击者已能在通话过程中实时伪装成他人身份,用于 CEO 诈骗、商务邮件诈骗(BEC)、客服冒充等社会工程场景。传统的被动检测思路是搜寻合成媒体留下的伪影(artifacts)或统计特征,但论文指出这类方法在实时通话中既容易被新的生成模型规避,也超出了普通人的辨别能力——用户研究显示,人在无辅助条件下很难把实时深度伪造与真实音视频区分开。 核心方法上,作者把 CAPTCHA(人机区分验证)的思想迁移到实时通话场景:不再被动找破绽,而是由系统主动向呼叫方下发简单、自然的挑战-应答任务(challenge-response),这类任务对真人来说容易完成,但对当前的实时深度伪造系统来说难以在通话时延约束下生成足够可信的响应。验证环节综合四项准则:真实性(合成痕迹与自然度)、身份一致性(响应是否与声称身份相符)、任务完成度(是否真正按要求完成交互任务)、以及响应时间(时延分布是否符合真人特征)。四项准则的组合用于降低单一信号被绕过或误判的风险。 评估方面,论文在音频与视频两种模态上分别开展用户研究与针对真实实时深度伪造模型的实验。结果显示:人类自身的辨别表现较差;而 DF-CAPTCHA 相比被动检测方法显著提升识别性能,并在两种模态上均达到较高准确率。作者据此认为,基于主动挑战的验证是应对下一代实时深伪社会工程攻击的一条实用且鲁棒的防御路径。本文适合从事身份验证、反欺诈、呼叫中心与视频会议安全、以及深度伪造检测方向的研究者与工程团队阅读。

💡 推荐理由: 实时语音/视频深伪冒充是 BEC、高管指令诈骗和客服欺诈的关键使能技术,而被动检测与人工辨别在实时通话中均不可靠。DF-CAPTCHA 提供了可落地的主动验证思路,安全团队可据此重新设计高风险通话的身份核验流程。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Oguzhan Salman, Kemal Bicakci

随着基于大语言模型(LLM)的智能代理(Agent)逐步渗透网络应用,视觉验证码正面临一种新的机械化威胁。以往专用检测器很慢或只处理固定类别,而视觉语言模型(VLM)能类人地看图识字,但每轮都从零开始推理,并不会从接触中积累经验。本论文提出一种可在每次交互中持续学习的验证码求解器架构:它由一个微调的 YOLOv8 快速检测器与一个开放权重 VLM 组成,通过置信度路由器协作,输入仅依赖截图与操作系统输入事件,不接入浏览器自动化或 DOM。在 16 类真实视觉验证码上,该系统获得了 85.4% 的整体准确率与 84.2% 的平均宏准确率,显著优于单独使用任一组件。其核心机制是“自我标注回环”——VLM 对每一个问题生成的答案都自动作为新的训练标签回流给检测器,使检测器逐步学习它原本没有训练过的类别,通常仅需遇到一两次,且无需人工标注。该回环还具备自修复能力:当 CAPTCHA 运营者能针对公开的检测器权重施加对抗扰动,并使其单独准确率降至 0% 时,VLM 的语义标签仍不受扰动影响,检测器借这些标签可快速恢复。论文用一个为期一年的对抗博弈模拟指出,即使运营方每月更换新的抗破解扰动,自适应求解器每一轮都能恢复;用约 70% 准确率的廉价开源 VLM 作为教师,也能达到接近完美 oracle 的强化效果。这个结果打破了“验证码一旦被绕过就会长期难以回归”的传统认知,提醒安全社区:仅仅依靠静态题库或局部对抗补丁不足以对抗能自我进步的机器智能。该研究对 CAPTCHA 服务设计者、风控团队与 AI 安全研究者均有重要参考价值。

💡 推荐理由: 视觉验证码一直被广泛用作反自动化防线,本文证明一个自我学习的 VLM/YOLO 混合求解器能快速掌握未知验证码新类别,且能在对抗扰动下自行恢复。安全运营者需要警惕其动摇现有注册/登录风控假设的潜力。

🎯 建议动作: 纳入内部评估

排序因子: 有可用补丁/修复方案 (+3) | 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Hoang Dai Nguyen, Karthika Subramani, Bhupendra Acharya, Roberto Perdisci, Phani Vadrevu

本论文设计并实现了 C-Frame,这是首个用于实时收集真实环境中 CAPTCHA 攻击数据的测量系统。作者首先研究了 CAPTCHA 协议和人工打码农场(human-driven farms)的近期演变,从中发现了一个独特的观察点,能够以全球规模开展 CAPTCHA 攻击测量研究。C-Frame 被设计为与 CAPTCHA 类型无关,并在伦理上进行了充分考虑。系统部署了 92 天,捕获了来自 1417 个网站的 425,257 次 CAPTCHA 攻击。为了对这些攻击进行分类,作者采用了一种由 3 名分析师参与的精心设计的定性分析方法,最终归纳出 34 种不同的 CAPTCHA 攻击类别,并附有多个真实世界的攻击案例。测量结果显示,Twitter 收到的 CAPTCHA 攻击数量最多(约 255,480 次请求),其中大部分试图创建机器人账号。研究还捕捉到了多种攻击类型,包括:票务黄牛(例如巴西泰勒·斯威夫特演唱会活动)、虚假诉讼索赔、滥用预约申请(例如中国境内的西班牙签证网站),以及通过 CAPTCHA 辅助下载政府网站数据(例如美国 20 个州的网站)的尝试。攻击来源分布在 5 大洲的 58 个国家。论文详细分析了攻击数据,提供了深入的测量分析见解,并提出了未来可能的补救措施。该研究为理解 CAPTCHA 攻击的生态、规模和方法提供了前所未有的真实数据基础,对 CAPTCHA 服务提供商、网站运营者和安全研究人员具有重要参考价值。

💡 推荐理由: 首个大规模真实世界 CAPTCHA 攻击测量系统,揭示了 CAPTCHA 攻击的规模、多样性和攻击者基础设施,为防御方理解攻击模式、优化验证码设计提供了量化依据。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 9.6
Conf: 50%
👥 作者: Yoshimichi Nakatsuka, Ercan Ozturk, Andrew Paverd, Gene Tsudik

本文针对Web服务中机器人滥用日益严重的问题,分析了现有CAPTCHA机制在对抗机器人时效果有限、给人类用户带来困扰以及可能侵犯用户隐私的缺陷。随着客户端可信执行环境(TEE)技术的普及(如ARM TrustZone和Intel SGX),作者提出利用客户端TEE来替代传统CAPTCHA的设想。论文设计并实现了CACTI(CAPTCHA Avoidance via Client-side TEE Integration)系统。CACTI利用客户端TEE作为信任根,使合法客户端能够生成不可伪造的“速率证明”(rate-proof),该证明可以展示用户执行特定行为的频率,从而向服务器证明其为人类用户而非机器人。用户无需解决CAPTCHA,即可通过提交速率证明完成身份验证。在隐私保护方面,CACTI采用组签名方案,确保客户端向访问网站发送信息时,不会泄露用户身份等敏感数据,仅能证明其属于合法客户端群体。实验评估表明,CACTI生成和验证一个速率证明的总延迟低于0.25秒,相比现有CAPTCHA系统,带宽开销降低了98%以上,显著提升了用户体验和系统效率。论文的贡献在于探索了TEE在反滥用领域的新应用场景,提供了一种更安全、更隐私友好的用户验证机制。

💡 推荐理由: 该研究提出用客户端TEE生成速率证明替代CAPTCHA,有望在减少用户干扰的同时提升反滥用效率,并保护用户隐私。对Web服务安全设计和CAPTCHA演进有重要指导意义。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
推荐 5.6
Conf: 50%
👥 作者: Benjamin Fehrensen, Jens Hubler

本文评估了通用大语言模型(LLM)在破解暗网环境中常见CAPTCHA验证码任务上的有效性。暗网CAPTCHA通常设计为无JavaScript运行,因此与主流验证码系统存在显著差异。研究选取了三种具有代表性的挑战类型:开放圆圈定位、旋转对齐和物体选择CAPTCHA。实验发现,当前多模态大语言模型(MLLM)虽能识别相关视觉结构,但在精确空间定位和几何变换处理上存在系统性缺陷。为缓解这些不足,作者提出两种途径:任务重构或为模型配备专用图像处理工具。最终,他们设计了一个混合框架,将MLLM作为高层推理与编排层,通过模型上下文协议(MCP)将几何计算委托给确定性算法。该框架在全部测试CAPTCHA类型上取得了超过90%的成功率,证明MLLM与经典计算机视觉的互补结合比任一单独方法更准确高效。研究意义在于揭示了MLLM的认知边界,并为类脑混合AI系统提供了设计范式。对安全社区而言,该工作警示CAPTCHA的有效性正面临新威胁,但也为设计更健壮的验证机制提供了参考。

💡 推荐理由: 暗网CAPTCHA是阻止自动化滥用的关键防线,本文展示通用LLM+工具可破解此类防护,提示防御者需重新评估验证码安全性,并探索抗LLM的验证码设计。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

本文针对基于LLM的浏览器代理对现有Web机器人防御系统的有效性进行了系统性评估。随着LLM代理能够自主导航网页、理解页面内容并通过自然语言指令与界面交互,传统的自动化框架(如Selenium)所面临的挑战被进一步放大。作者对比了两种防御类型:交互式挑战类防御(如hCaptcha、reCAPTCHA v2、Cloudflare Turnstile)和非交互式信任类防御(如reCAPTCHA v3)。实验涉及7种商业验证码破解服务和6种LLM代理(包括云托管、自托管、AI辅助和浏览器扩展配置)。结果显示,交互式防御对商业破解服务几乎无效(接近100%绕过且成本极低),而LLM代理在配备专用破解模块时也能有效绕过。非交互式防御(如reCAPTCHA v3)表现出更强的抵抗力,但通过细粒度交互轨迹分析发现,这种抵抗力并非源于安全性的根本提升——具有几乎相同行为足迹的两个代理产生截然不同的结果(一个绕过,一个失败),表明决定因素是执行环境的真实性而非代理行为。这一发现揭示了非交互式防御的安全边界位于环境层,对机器人管理系统的设计和评估具有重要启示。

💡 推荐理由: LLM代理正重塑网络威胁格局,本研究首次系统评估了其对主流机器人防御(验证码等)的实际绕过能力,揭示现有防御体系的根本脆弱性,迫使安全社区重新审视基于行为检测或挑战的防线。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 8.5
Conf: 50%
👥 作者: Md Neyamul Islam Shibbir, Md Hasibur Rahman, Farida Chowdhury, Md Sadek Ferdous

该论文提出并实现了一种基于孟加拉语的文本验证码(CAPTCHA)机制,旨在解决传统英语验证码对非英语母语用户存在的可用性问题。这是首个针对孟加拉语用户的文本验证码方案。作者设计了6种变体,并通过6000个挑战(每种变体约1000个)进行自动化OCR攻击测试,平均字符识别率仅为0-20%,表明其具有较强的安全性。同时,通过110名参与者的用户可用性评估,6种变体的成功率为56.25%至90.29%,平均响应时间为6.69至9.9秒,在文本验证码基准中表现突出。论文详细阐述了设计原理、实现细节以及实验结果,证明了该方案在安全性和可用性之间的良好平衡。研究为区域语言用户提供了更友好的安全防护手段,并为未来多语言验证码设计提供了参考。

💡 推荐理由: 该研究解决了非英语用户(特别是孟加拉语使用者)在验证码可用性上的痛点,同时维持了较强的抗OCR攻击能力,为提升全球网络安全包容性提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Ruijie Zhao 0001, Xianwen Deng, Yanhao Wang, Zhicong Yan, Zhengguang Han, Libo Chen 0001, Zhi Xue, Yijun Wang

文本验证码(text-based captcha)作为一种区分人类用户与机器人的安全机制,虽然已面临多种攻击方法,但仍被广泛使用。近年来,基于深度学习的验证码破解器取得了显著效果,但其高度依赖大量人工标注数据,成本高昂且耗时。此前的一些工作试图通过有限的标注数据集构建易用的破解器,但受限于低效的预处理流程以及对具有复杂安全特性的验证码的识别能力不足。本文提出了一种名为 GeeSolver 的通用、高效且省力的文本验证码破解器,其核心思想是:许多难以攻破的验证码方案通过“破坏”标准字体来增加难度,这种破坏类似于图像中的遮挡(mask)。受此启发,作者利用掩码自编码器(Masked Autoencoder, MAE)架构,让模型从验证码图像中未被遮挡的部分学习潜在表示,从而推断出对应的字符。具体而言,GeeSolver 包含一个 ViT(Vision Transformer)编码器作为潜在表示提取器,以及一个精心设计的解码器用于验证码识别。编码器通过 MAE 范式进行预训练,使其能够仅从局部信息(即未被遮挡的部分)提取出足以推断字符的潜在表示。随后,编码器参数被冻结,利用少量标注验证码和大量未标注验证码,通过半监督学习训练解码器。实验在真实世界的验证码方案上进行,结果表明:GeeSolver 在使用少量标注数据的情况下,大幅超越了当前最先进的方法;同时,它效率极高,使用桌面级 CPU 可在 25 毫秒内破解一个验证码,使用 GPU 仅需 9 毫秒。此外,得益于潜在表示提取能力,GeeSolver 成功破解了先前难以攻击的验证码方案,证明了其通用性。作者希望这项工作能帮助安全专家重新审视文本验证码的设计与可用性。代码已开源。

💡 推荐理由: 该研究展示了自监督学习显著降低了文本验证码破解的门槛,即使只有少量标注数据也能高效攻击复杂验证码,迫使安全从业者重新评估验证码的安全性。

🎯 建议动作: 研究跟进,验证码设计者需评估新型自监督学习方法对自身方案的影响,考虑引入行为验证、多模态验证或更复杂的图灵测试。

排序因子: 来自网络安全顶级会议 (+8) | Community 数据源 (+1) | LLM 评分加成 (+0.5)