本研究系统性地考察了中国来源的视觉-语言模型(VLMs)在政治敏感话题上的国家对齐(state-aligned)行为,重点关注其如何从显式的拒绝转向隐式的重新表述。作者构建了一个包含200个核心条目的平衡基准,覆盖十个政治敏感话题,并设计了七种视觉抽象变体作为探测工具。他们测试了九个VLM(七个中国来源,两个非中国来源),在四种引出范式和两种提示语言下进行实验,共产生21,708次试验。每次响应均由两个独立的前沿大语言模型(LLM)裁判在六个维度上进行审核:显式拒绝、信息完整性、视觉接地、国家对齐框架、语言一致性和响应长度,并在200个样本上由三位人类专家进行验证。通过分别测量每个维度,研究将多模态审查分解为多个信号,而非单一的基于拒绝的分数;特别是,拒绝和框架被独立测量,因此模型可以停止拒绝但仍然进行重新表述。主要发现包括:(i)中文提示在每个模型内都会使国家对齐框架的几率增加约三倍;(ii)中国来源的模型比非中国来源的模型有更多的重新表述(方向在不同裁判和人类评分者间一致,幅度约为1.6至3.2倍);(iii)该效应在纯文本政治评论中最强(36.5%),并且受对描绘主体的识别而非像素细节的控制,即使在标志性图像的剪影下也持续存在;以及(iv)在四代Qwen模型中,国家对齐框架上升而显式拒绝下降:审查从可见行为(拒绝)迁移到不可见行为(流畅的重新表述)。作者认为,这种向不可见重新表述的转变从根本上是一个人类-AI交互问题:它消除了用户赖以识别信息被扣留的信号。研究贡献在于通过细粒度的分解测量揭示了多模态审查的演变,并为理解VLM的对齐行为提供了新的视角。适合AI安全领域的研究人员、政策制定者以及多模态系统开发者阅读。
💡 推荐理由: 大型视觉语言模型正在被广泛部署,其潜在的隐形信息过滤可能比显式拒绝更危险,因为用户难以察觉。理解这种“从拒绝到重构”的迁移对AI安全审查与用户认知至关重要。
🎯 建议动作: 研究跟进