#architecture

共收录 3 条相关安全情报。

← 返回所有主题
推荐 11.5
Conf: 50%
👥 作者: Evan Li, Tushin Mallick, Evan Rose, William K. Robertson, Alina Oprea, Cristina Nita-Rotaru

本文研究 LLM 集成应用系统(LLM-integrated app systems)的安全性问题。这类系统通过第三方应用扩展大语言模型(LLM)的功能,系统 LLM 采用交错规划和执行的方式调用第三方应用来回答用户查询。然而,这种架构引入了新的攻击面:恶意应用可能导致规划或执行的完整性被破坏、可用性中断或执行期间的隐私泄露。作者首先识别出若干新型攻击,这些攻击分别影响规划完整性、执行完整性和可用性,并在最近的防御方案 IsolateGPT 上进行了演示,表明现有方案仍存在不足。针对这些问题,论文提出了 ACE(Abstract-Concrete-Execute)安全架构,为 LLM 集成应用系统提供规划与执行的安全保证。ACE 的核心思想是将规划过程解耦为两个阶段:第一阶段仅基于可信信息生成抽象执行计划,第二阶段利用已安装的系统应用将抽象计划映射为具体执行计划。系统通过静态分析结构化的计划输出,验证用户指定的安全信息流约束是否得到满足。在执行阶段,ACE 在应用之间强制实施数据和能力隔离屏障,并确保执行过程严格遵循可信的抽象计划。实验结果表明,ACE 能有效抵御 INJECAGENT 与 Agent Security Bench 基准中的间接提示注入攻击,以及作者新发现的攻击。同时,作者在 LangChain 基准的 Tool Usage 套件上评估了 ACE 在真实环境中的效用,证明其不仅安全,还能保持较高的任务可用性。总体而言,ACE 将系统安全原则引入 LLM 系统加固,是该领域一项重要的研究进展。

💡 推荐理由: LLM 集成应用系统面临新兴的提示注入与恶意应用攻击,本文提出的 ACE 架构通过规划分离、静态验证和执行隔离,为构建安全的 LLM 代理提供了一套可落地的设计范式,对防御者设计防护方案具有重要参考价值。

🎯 建议动作: 建议安全团队阅读全文,评估 ACE 架构在自身 LLM 应用中的可借鉴性,并进行概念验证。

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Dewank Pant, Shruti Lohani, Avijit Kumar

该论文研究了大型语言模型(LLM)集成应用中 prompt injection 攻击的根本原因。作者证明,在共享嵌入架构中,如果缺乏强制性的控制与数据分离,完美防御 prompt injection 在数学上是不可能的。论文形式化定义了“提示动作模型”(Prompted Action Models),其输出包括控制性动作(如拒绝决策、工具授权、策略路由和内存写入),并提出了“语义忠实控制”(Semantic-Faithful Control, SFC)属性,即控制行为仅依赖于不可信输入的含义,而非其编码方式。通过三项理论结果证明 SFC 不可实现:源恢复不可能性(共享表示使得可信与不可信内容在统计上不可分离,受限于总变差距离)、控制路径暴露(不可信令牌通过相同的注意力值聚合进入控制相关计算)以及有限覆盖不变性间隙(有限训练无法在无限语义等价类上认证不变性)。这些结论在真实分词器和模型上通过测量得到了验证。作者指出,这一结果是结构性的,而非当前防御的漏洞,类似于冯·诺依曼架构中代码与数据混淆导致的缓冲区溢出问题——后者花费数十年才通过分层防御(DEP、W⊕X、ASLR、栈金丝雀、内存安全语言)得以控制。因此,prompt injection 不能仅通过更好的管道内分类或对齐来消除,而需要指令与数据通道的架构级分离。该论文适用于从事 LLM 安全、架构设计和对抗性机器学习的研究人员。

💡 推荐理由: 从理论层面揭示了 prompt injection 无法被彻底防御的根本原因,为 LLM 安全提供了新的认知框架,并指明了架构级分离的必要方向。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
👥 作者: Sam Ryan

本文提出了一种名为“语义非组合”(Semantic Non-Assembly, SNA)的新型隐私保证框架。与传统的基于保密性、访问控制或统计披露限制的隐私模型不同,SNA 从“暴露发生时信息收益”的角度定义隐私:即使攻击者能够完全暴露和解密某个子系统中的任意组件(低于阈值),也无法获得可操作数据。核心思想是阻止任何低于指定阈值的组件联盟组装出足以评估特定谓词的完整输入域赋值。该保证是结构性的,通过体系架构而非策略实现,且隐私属性在组件被攻陷时以可预测的方式退化,而非单点崩溃。参考实现将结构保证与经过审计的组织约束相结合(附录A形式化描述)。论文形式化了SNA保证,并使用ProVerif验证了四个关键属性:设备非关联性、注册观测器非识别性、提交服务器盲目性以及主动防御门正确性。前三个属性通过双通道溯源架构实现。Birthmark标准实例在受限捕获硬件上实现了该保证,展示了零知识证明方法计算不可行场景下的可部署性。所有形式化属性和范围限制均记录在附录A中。该工作适合对隐私架构、分布式系统安全及形式化验证感兴趣的研究人员阅读。

💡 推荐理由: 提出了一种颠覆传统隐私定义的思路,从防止数据泄露转向降低泄露时的信息收益,为组件暴露场景提供可量化的隐私保证,对分布式系统与物联网隐私设计具有启发性。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)