#bit-flip-attack

共收录 1 条相关安全情报。

← 返回所有主题
👥 作者: Yu Yan, Jiahao Chen, Siqi Lu, Yongjuan Wang, Ziming Zhao, Zhaoxuan Li, Tianyu Du, Qingjun Yuan, Shouling Ji

该论文提出了一种针对大语言模型(LLM)的新型攻击范式——决策级劫持(Decision-Level Hijacking)。攻击者通过部署后仅翻转极少量权重比特(Bit-Flip Attack)的方式,在不触发违规内容或降低模型功能的前提下,向LLM注入特定的认知偏差,从而间接影响下游决策者的判断。现有攻击无法实现这种精细的认知操控。为此,作者提出了CogBias框架:首先利用可微情绪评估器将主观偏好转化为优化信号;然后设计多目标损失函数联合约束多个维度(如立场、一致性等);最后通过BitScout算法定位关键比特位,在超稀疏翻转预算下实现定向认知干预。在Llama-3.2-3B、Mistral-7B和Qwen2.5-14B等模型上,针对商业推荐和争议性事实话题场景的实验表明,仅翻转少量比特即可稳定地使模型对目标话题产生显著的立场偏移,同时对非目标任务和整体输出分布的影响有限。该工作揭示了底层权重数据的微小扰动足以破坏LLM的高层价值对齐,对开源模型的安全部署提出了严峻挑战。

💡 推荐理由: 该研究首次证明比特翻转攻击能用于操控LLM的决策立场,且无需实时交互或控制训练过程,隐蔽性强、成本低,对依赖LLM进行战略决策的企业构成直接安全威胁。

🎯 建议动作: 研究跟进

排序因子: 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.6)