#white-box-auditing

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Zhen Guo, Shanghao Shi, Shamim Yazdani, Ning Zhang, Reza Tourani

LLM 攻击涵盖提示优化、多轮上下文操纵、检索投毒和模型后门等多种机制,但现有白盒防御通常仅在孤立的攻击家族上评估,因此异构攻击是否会在内部表示中留下可泛化的位移信号仍属未知。本文提出 MechAudit-40,一个系统性的评估框架,在 5 个开源权重模型架构上测试了 40 种攻击机制。通过威胁特定的成功标准、10 万对匹配的“干净-攻击”表示、预定义类别与分组留出,该方法将真正的攻击诱导位移与目标规模、语料库偏差和数据泄漏捷径隔离开来。实验发现,攻击会引发结构化的多深度轨迹,而非孤立的层尖峰;原始峰值在不同架构间不可移植,但目标校准后的轮廓保留了可迁移的几何特征——在完全机制留出条件下,仅凭隐藏状态即可对未见攻击的威胁类别达到 82.5% 的准确率。基于此,作者设计了 MechAudit,一个运行时审计器,它在严格的零预言机约束下工作,无需干净基线痕迹或攻击元数据。MechAudit 在 0.70% 的假阳性率下检测出 81.1% 的留出攻击,当整个功能类别被屏蔽时仍保持 78.1% 的召回率。在匹配对比中,MechAudit 是唯一未发生机制级覆盖崩溃的检测器,在全部 40 种机制上均保持超过 50% 的召回率。研究结论表明,内部表示能够支持基于校准良性参考的跨机制攻击暴露审计,但这种能力与下游任务危害及参数完整性脱钩。该工作为 LLM 白盒安全评估和运行时监控提供了新的视角与方法基础。

💡 推荐理由: 这一研究表明,通过监控模型内部表示可检测多种未见过的攻击机制,为LLM运行时防御提供了可泛化的技术路线,对蓝队构建纵深防御体系具有重要启发。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)