#semantic-matching

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Qikai Wang, Yongzhao Zhang, Zhiwei Chen, Yimiao Sun, Jiguo Yu, Xiaosong Zhang

本文研究了大语言模型(LLM)代理系统中的技能选择阶段的安全性。技能选择是决定用户请求由哪一个已安装技能来处理的关键环节。现有攻击手段主要依赖显式提示注入或指令级转向,这些方法容易暴露出可识别的操纵特征。针对这一空白,作者发现了一种新的隐式攻击面:即使单个用户提示和技能描述看起来都完全良性,攻击者仍可通过精心设计二者之间的语义关联,使模型倾向于选择攻击者指定的技能。基于此,提出了'基于语义匹配的隐式技能选择操纵'(ISM)方法。ISM通过联合改造目标技能的元数据和可复用的提示模板,在完全不包含显式选择指令的情况下,实现对技能选择过程的隐蔽操纵。具体而言,ISM采用三阶段策略:拓宽语义覆盖范围、增强目标技能的区分度、保持提示自然措辞以避免异常。在四个任务领域和八个不同选择器模型上的实验表明,ISM能将平均目标选择率(TSR)从15.2%提高至63.5%。在受控对比实验中,其TSR达到73.5%,仅比显式转向方法低9.8个百分点。更重要的是,人机审查实验显示,人类审查者仅在2.9%的判断中拦截了ISM的攻击,而显式转向的拦截率为91.4%;五个LLM检测器对ISM的平均放行率高达82.9%,对显式转向仅为37.4%。此外,ISM在PPL-W、Llama Prompt Guard 2和PIGuard等防御措施下依然有效。这一研究揭示了一种难以察觉的、针对技能选择环节的新型攻击方式,对LLM代理的实际部署安全构成了严峻威胁,也为防御方提出了新的技术挑战。

💡 推荐理由: 技能选择是LLM代理工作流中的关键信任边界。ISM表明攻击者无需依赖显式注入,仅通过调整技能元数据与提示的语义关系即可实现隐蔽操纵,现有检测手段和人类审查均难以识别。这会给依赖多个技能的自动化代理带来严重安全隐患,防御方需意识到这类隐式语义攻击的存在。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Samuel Witt, Hassan Habibi Gharakheili

该论文针对物联网设备准确识别这一关键安全问题,提出了一种基于制造商使用描述(MUD)配置文件的语义识别方法。现有方法通常从数据包或流记录中学习设备签名,但这些低层通信观测的流量模式会随部署环境、软件版本和用户交互而变化,导致识别鲁棒性不足。MUD配置文件通过访问控制条目(ACE)描述设备行为,每个ACE包含协议、端点、方向和端口语义,构成行为原语。论文贡献包括三个方面:第一,利用28个公开MUD配置文件中的1023个ACE实例,构建了紧凑行为文本的ACE级语义表示,并分析其几何特性。实验表明,ACE级表示比整体配置文件嵌入更有效地保留设备级行为区分,且经过白化校准后仍然有效。第二,在受控运行时变化下(包括未见ACE、主机名漂移、部分运行时观测)评估语义ACE匹配性能。精确ACE匹配在规范MUD重叠率高时表现良好,但重叠稀疏或消失时性能急剧下降;而语义ACE匹配能在这些条件下保持有用的识别证据。第三,在包含超过80万条观测流量的真实IoT流量轨迹上评估。结果表明,当存在稳定重叠时精确匹配最强,但在观测早期语义匹配提供更强的识别证据,通常能将正确设备保留在最高候选之中,并在稀疏重叠的运行时流量下保持有效性。该研究为IoT设备识别提供了不依赖流量模式变化的语义级解决方案,特别适用于零日设备或动态环境。

💡 推荐理由: IoT设备准确识别是安全管理和策略执行的基础,现有方法易受环境变化影响。本文提出的语义ACE匹配方法在观测早期和稀疏重叠场景下仍保持鲁棒,为实际部署中的设备识别提供了新的、更可靠的途径,尤其适合MUD策略生效前的初期识别。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)