推荐 3.6
Conf: 50%
本文提出了一种名为 Derail 的对抗攻击框架,针对当前生成式端到端自动驾驶规划器中的评分头(scoring head)进行攻击。生成式规划器(如基于扩散去噪或词汇检索的模型)在推理时,通常会生成一组候选轨迹(锚点、词汇条目或提议查询),然后通过一个或多个学习到的评分头(基于鸟瞰图特征)对候选轨迹进行打分,最终选择得分最高的轨迹作为输出。研究发现,评分头作为感知与运动指令之间的唯一屏障,其决策边界往往很小,容易受到微小的对抗扰动影响。Derail 框架通过优化安全违反目标(safety-violating objectives),使得原本安全的候选轨迹得分下降,而不安全的轨迹得分上升,从而翻转轨迹选择。实验在多种生成式规划器上进行,结果表明 Derail 能使得分下降 39%--80%,碰撞率高达 50%,且效果优于传统的损失最大化攻击和特征散度攻击。论文进一步分析指出,安全违反目标是攻击有效性的关键驱动因素,而评分头推理模式本身是一种反复出现的攻击面,值得防御者明确考虑。该研究揭示了自动驾驶生成式规划器的一个根本性安全缺陷,即对评分头的安全依赖性可能被利用导致严重碰撞事故。适合自动驾驶安全研究员、AI安全从业者以及自动驾驶系统开发者阅读。
💡 推荐理由: 自动驾驶生成式规划器的评分头是感知到运动指令的唯一屏障,其微小决策边界易被攻击者利用,导致安全轨迹被替换为危险轨迹。该研究首次系统性地揭示了这一攻击面,对自动驾驶安全性具有警示意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)