该论文提出 DualityCert,一个专为四维 N=1 quiver 规范理论中 Seiberg 对偶性声明设计的符号验证器。验证器检查 't Hooft 异常匹配、超势 R-荷一致性、中心荷匹配以及一个有界的手征环代理。通过验证的声明获得一致性证书,但仅表明未发现被测试的不一致性,而非证明对偶性成立。研究者将验证器作为语言模型代理的修复环境:代理接收一个故意被破坏的声明,并编辑它直至通过验证。在包含 145 个被破坏声明的预注册基准上(分析在第一次确证模型调用前固定),验证器门控重试相比单次尝试将最终修复成功率提升了 +8.3 个百分点(deepseek-chat)和 +7.1 个百分点(qwen-plus,Holm 校正 p<0.002)。在相同预算(11 次尝试)下,停止优先策略组合在 deepseek-chat 上弱于独立验证器过滤重采样 10.3 个百分点,但在 qwen-plus 上反而强 14.7 个百分点,逆转了两种验证器利用策略在两个确证模型上的顺序。在 qwen-plus 上,类别级验证器反馈相比无内容重试提升 +8.7 个百分点,而可解释的义务恒等式单独相比结构相同但被掩码的反馈提升 +6.4 个百分点;在 deepseek-chat 上未检测到这些效应。另外,预注册的 MiniMax-M2.5 扩展实验再次观察到迭代收益,且独立验证器过滤重采样优于策略组合。因此,哪种策略更优因模型而异,而所有获胜策略都使用了相同的廉价证书。该论文发布了验证器、基准、协议及所有逐次尝试记录。该研究展示了符号验证器与语言模型代理结合的有效性,对 AI 辅助科学推理和形式验证领域具有参考价值。
💡 推荐理由: 展示了将符号验证器作为 LLM 代理的修复环境,可提升 LLM 在形式化任务中的正确性。该思路可迁移至安全配置修复、代码验证等场景,为构建更可靠的 AI 安全助手提供新范式。
🎯 建议动作: 研究跟进