#model-editing

共收录 2 条相关安全情报。

← 返回所有主题
👥 作者: Weifeng Sun, Quanjun Zhang, Yuchen Chen, Chengran Yang, Gou Tan, David Lo

本文针对大型语言模型(LLM)在代码生成任务中可能复现不安全训练模式、生成漏洞代码的问题,首次系统性地研究了模型编辑(model editing)作为一种模型级安全硬化机制的有效性。与先前主要聚焦于推理时加固(如CoSec)的方法不同,模型编辑直接修改模型参数,无需额外辅助组件且不增加运行时开销。作者在多种LLM家族上评估了三种最先进的模型编辑方法,并与代表性推理时方法CoSec进行对比,考察了安全性、鲁棒性、泛化能力和功能正确性。实验发现,模型编辑在已见漏洞类型上比CoSec带来更大的安全收益,安全比例较原始模型提升15%-25%,且在提示扰动下保持稳定;然而,这些改进无法可靠迁移到未见漏洞,且可能降低功能正确性。为缓解这一权衡,作者提出了SafeEdit,一种结合功能调优和编辑感知正则化的编辑后优化方法。在八个目标LLM上,SafeEdit在T=0.1/0.4/0.8时相比UltraEdit将Pass@1分别提升了11.73/13.70/15.50个百分点,同时基本保持安全性。与CoSec相比,SafeEdit实现了7.54%-12.04%的相对安全比例提升。额外的CodeGuard+评估证实了联合安全且正确生成的改进。SafeEdit与CoSec具有互补性,组合使用可进一步提升安全性并保持强功能正确性。总体而言,本文为将模型编辑应用于安全代码生成提供了基于证据的指导。

💡 推荐理由: 为LLM安全代码生成提供了模型级硬化新思路,评测多种编辑方法的优劣,提出SafeEdit缓解安全-正确性权衡,对安全工程师选择防御策略有直接参考价值。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)
推荐 10.6
Conf: 50%
👥 作者: Yi Wang, Hongye Qiu, Yue Xu, Sibei Yang, Zhan Qin, Minlie Huang, Wenjie Wang

大型语言模型(LLMs)和视觉语言模型(VLMs)在展现强大能力的同时,仍容易受到越狱攻击(jailbreaking attacks)的威胁,攻击者利用文本或视觉触发器绕过安全护栏。现有的防御方法通常依赖安全微调或外部过滤器来降低模型生成有害内容的概率,但这类方法往往带来显著的计算开销,并面临安全-效用权衡问题,即损害模型在良性任务上的表现。为了应对这些挑战,本文提出EVA(Editing for Versatile Alignment against Jailbreaks)框架,首次将直接模型编辑(direct model editing)应用于安全对齐。EVA将安全对齐重新定义为一种精确的知识修正任务:不是重新训练大量参数,而是识别并精准编辑那些导致模型易受有害指令影响的特定神经元,同时保持模型绝大多数参数不变。通过局部化更新,EVA有效中和有害行为,而不损害模型的通用推理能力。大量实验表明,EVA在LLMs和VLMs上均优于基线方法,在缓解越狱攻击方面提供了精确且高效的解决方案,适用于部署后的安全对齐。

💡 推荐理由: EVA提出了一种轻量级、非侵入式的安全对齐方法,通过模型编辑精准修复漏洞,避免传统微调的副作用,为LLM/VLM的部署后安全维护提供了新思路。

🎯 建议动作: 研究跟进

排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)