推荐 5.5
Conf: 50%
该论文聚焦于基于大语言模型(LLM)的Agent技能系统的安全扫描盲区。现有技能扫描器主要分析文本描述、manifest和源代码,忽略了视觉内容可能携带恶意指令的风险。为此,作者提出了一种名为SkillCamo的多模态隐藏指令攻击方法:攻击者将恶意操作指令嵌入技能包的图像中,并改写配套文档使其自然引用这些图像作为正常流程的一部分。这样,在部署阶段,多模态Agent在执行技能时会联合解读文本提示和图像载荷,从而触发恶意行为,而扫描阶段仅检查文本则无法发现。为防御此类攻击,论文进一步提出ExecScan——一种基于执行的扫描模块,通过对技能工件进行意图提取、行为重建、滥用评估和审慎执行模拟,联合分析文档、代码、引用资源和视觉内容,以恢复隐藏指令、重建可执行行为链,并识别数据外泄、系统破坏、持久化、欺骗和权限提升等下游风险。实验结果表明,现有的技能扫描器无法有效检测图像隐藏的恶意指令,而ExecScan显著提升了扫描性能。该工作揭示了多模态Agent安全中视觉信息被忽视的攻击面,并提供了实用的检测框架,适合LLM安全研究人员、Agent平台开发者和安全运维工程师阅读。
💡 推荐理由: 首次系统揭示了多模态Agent技能中图像承载恶意指令的盲区,并提出了可落地的检测方法ExecScan,对防御基于Agent的攻击具有直接指导意义。
🎯 建议动作: 研究跟进
排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)