该论文研究了通过智能眼镜拍摄的视频进行密码推断的侧信道攻击。研究背景是用户在公共场所使用智能手机输入密码时,可能被攻击者录制视频并通过分析手指运动恢复密码。此前基于视频的键盘侧信道攻击仅针对平板上的自由文本、数字PIN、图案锁等,且条件过于简化。本文首次提出一种通用的基于视频的键盘推断流水线,能够恢复符合规则、包含字母数字的密码,覆盖智能手机QWERTY键盘的全部四种布局,且对受害者或设备无任何假设。该流水线利用常见智能眼镜(如Meta Ray-Ban)的摄像头,以亚像素分辨率追踪设备与击键手指,通过自监督神经网络集成预测击键,动态估计屏幕键盘布局,并计算每个按键的概率分布。随后将视频推断的概率与基于21.9亿泄露密码的先验打字分布结合,估计密码的排名,从而推断破解时间。用户研究中,符合典型企业密码策略的人类自选密码(最长16字符)可在数小时至数天内被破解;而密码管理器生成的随机密码(最长13字符)在当代GPU上不到一小时即可破解,与先前基线相比密码熵可降低最多60比特。对于人类自选密码,将视频证据与先验统计结合相比单独使用任一来源,额外获得约20比特的熵减。该攻击在距离最远1.8米时依然有效,适用于多种攻击者-受害者姿态和视角,并能泛化到三款主流智能手机。该研究主要贡献在于提出了首个通用、无需假设的视频键盘推断框架,并实证了智能眼镜带来的现实威胁。适合安全研究人员、移动设备安全团队以及密码策略制定者阅读。
💡 推荐理由: 智能眼镜等可穿戴摄像设备普及,使大规模视频侧信道攻击成为现实,用户密码可能在公开场所被轻易窃取。该研究突破了以往攻击的限制条件,威胁面显著扩大,值得移动安全和隐私保护从业者关注。
🎯 建议动作: 研究跟进