#self-evolving

共收录 3 条相关安全情报。

← 返回所有主题
推荐 5.7
Conf: 50%
👥 作者: Xiaodong Wu, Yu Shi, Qi Li, Zhimin Zhao, Xiangman Li, Bram Adams, Ahmed E. Hassan, Jianbing Ni

本文由多所高校和机构的研究人员提出,关注自我进化的大语言模型(LLM)编码代理的安全漏洞。此类代理能够从共享技能库中检索示例,并通过模仿这些示例来自动编写新技能。研究人员发现,这一自我进化过程中存在一种可被利用的“自我投毒”(self-poisoning)漏洞:当代理检索到恶意技能时,该恶意技能可能成为新技能的模板,从而保留其中的恶意负载。攻击者可将恶意技能预先植入技能库,无需直接调用,代理便会模仿并生成携带恶意代码的新技能,并可能将其执行、存储并再次写回库中,形成自我传播的蠕虫。论文提出了 EvoMal 攻击框架,通过将可互换的恶意负载包裹在看似良性的“banner”结构元素中,诱导模仿代理完整复制包含的代码。该攻击可在植入技能被移除后持续存在。作者定义了代理自我投毒率(ASPR)作为评估指标,并在 153 个工具相关的 SWE-bench Verified 任务上对六个模型进行了实验。结果显示,ASPR 范围为 20.3% 至 41.8%,中毒库中的恶意技能数量是植入数量的 4.9 至 9.0 倍。即使没有 banner,DeepSeek-V4-Pro 也能达到 11.1% 的 ASPR。将植入技能描述针对单一任务家族定制后,ASPR 可高达 86.7%。在移除植入技能后,Qwen3 仍保持 68% 的第 5 轮 ASPR,表明代理自制的副本导致漏洞持续存在。现有防御措施主要关注攻击者提交的名称、代码和签名,无法有效防御此类攻击。作者提出了一种名为“counter-prompt”的防御策略,通过抑制 banner 风格的复制,将 EvoMal 的 ASPR 降至 6.7% 以下,同时不显著影响任务完成度。该工作揭示了自我进化代理系统面临的新型供应链攻击风险,并为安全防御提供了新的思路。

💡 推荐理由: 自我进化型 LLM 编码代理已成为软件供应链的潜在入口,本研究揭示了一种无需直接调用即可感染代理并自我传播的攻击方式,现有防御难以检测。对于构建或使用此类代理的团队,这是必须关注的新型威胁,且其传播特性可能造成持久影响。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.7)
👥 作者: Ruixiao Lin, Xinhao Deng, Qingming Li, Jianan Ma, Yunhao Feng, Yuqi Qing, Zhenyuan Li, Yechao Zhang, Shiwen Cui, Changhua Meng, Tianwei Zhang, Xingjun Ma, Qi Li, Ke Xu, Shouling Ji

本文系统性地研究了自进化LLM智能体系统(即能够自主更新其模型参数、记忆、工具和架构的智能体)带来的新型安全与隐私威胁。作者首先提出模块-生命周期攻击面(MLAS)矩阵,将攻击面分解为五个功能模块(大脑、认知资源、执行、自我设计、集体)和五个生命周期阶段(引导、提议、评估、提交、服务),共形成25个单元格。分析发现其中17个单元格面临严重的威胁,且目前缺乏有效的局部缓解措施。此外,作者识别出七种跨模块的放大效应,这些效应会协同作用,无法通过单独保护某个模块来解决。通过对两个开源框架的对比案例研究表明,原生支持进化的框架激活的攻击面细胞数量是传统框架的3.5倍,并且达到100%的攻击持久性(所有40个负载在所有CIA+隐私类别中均持续有效),而传统的安全扫描器仅能阻止2.5%的攻击。本文的核心贡献在于:揭示了自进化机制将每种已知攻击类别从会话受限转变为沿袭持久性,催生了全新的攻击类别,并证明静态防御在结构上无法应对此类威胁,从而呼吁建立进化感知的安全框架和对自修改系统的形式化验证。

💡 推荐理由: 本文首次系统性地揭示了自进化LLM智能体系统特有的安全威胁,指出了静态防御的根本性不足,对于指导未来LLM智能体系统的安全设计具有重要价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)
👥 作者: Junwei Zhou 0002, Yuyang Gao, Cheng Tan, Yanchao Yang 0002, Jianwen Xiang

该论文提出了一种名为 GLog 的自进化日志异常类型预测框架,旨在解决现有日志异常检测方法在多云和微服务环境中的局限性。传统方法通常只能进行二分类(正常/异常),难以适应动态变化的日志模式,且在日志解析过程中存在语义损失问题。GLog 是一个端到端框架,不需要人工标注的异常类型标签即可动态预测异常类型。其工作流程分为两个阶段:首先,使用正常/异常标签对指令微调的大语言模型(LLM)进行微调,使其能够在原始未解析的日志序列上实现高精度异常检测;然后,对检测到的异常进行聚类,自动生成伪异常类型标签和描述,并用于第二阶段微调,使模型能够预测具体的异常类型并输出可解释的结果。GLog 通过利用完整日志语义并动态更新异常类型库,减少了人工标注成本,能够适应大规模环境中系统行为的演化。实验在多个数据集上验证了其有效性。

💡 推荐理由: 该工作针对日志异常检测的细粒度分类和自适应能力不足提供了创新方案,结合 LLM 和聚类实现自动化的异常类型预测,有望减轻运维人员的分析负担。

🎯 建议动作: 研究跟进

排序因子: 来自网络安全顶级会议 (+8) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)