该论文针对自动驾驶汽车(AV)依赖全球导航卫星系统(GNSS)进行定位和导航,易受欺骗攻击(如轨迹重定向、急停等)的问题,提出了首个基于视觉-语言模型(VLM)的GNSS欺骗检测框架。方法创新地融合了前置摄像头视觉数据与车载传感器读数(速度、加速度、偏航率),并与GNSS导出的机动行为进行对比。作者设计了三阶段微调流程:首先对齐视觉线索,然后在共享语义空间中校准传感器数据,以检测在三种攻击场景下预测机动与GNSS导出机动之间的差异。为验证模型跨区域泛化能力,团队在阿拉巴马州塔斯卡卢萨县公共道路上采集了实车数据集(含时间同步的GNSS、IMU和相机日志),并生成了智能欺骗攻击样本,包括带道路网络匹配的轨迹镜像(错误转弯攻击)、位置冻结(过冲攻击)和漂移生成(停车攻击)。实验表明:零样本VLM基线F1分数仅为23%-32%,而微调后的模型F1分数达到94%-95%;错误转弯和停车攻击分类准确率100%,过冲攻击准确率88%-93%。此外,引入自适应推理策略将VLM调用次数降至14%(计算量减少约86%),每4秒窗口处理时间为65-73毫秒,证明了该方法作为实际道路上补充信号级完整性检查的防御层的可行性。
💡 推荐理由: 首次将VLM应用于自动驾驶GNSS欺骗检测,通过多模态融合实现高精度(>94% F1)且低计算开销(86%推理减少),为自动驾驶安全提供了新颖的感知级防御思路。
🎯 建议动作: 研究跟进