推荐 10.5
Conf: 50%
该论文提出FIDES,一个用于评估LLM生成交易策略一致性的测量协议。LLM在回答交易策略请求时,通常会同时返回自然语言理由、可执行代码以及回测业绩三个产物,但少有研究验证三者是否一致。FIDES将这三个产物视为三个需要相互印证的视图,而非单一可评分的交付物。具体流程是:通过双重交付,在一次模型调用中同时获取自然语言策略及其声称的明确优势,以及一个自包含的strategy(df)函数;随后在沙箱环境中对滞后一期的样本外数据进行回测,并计算三个一致性差距:say-to-do(语言声明与代码行为)、do-to-real(代码执行与实际回测结果)、say-to-result(语言声明与最终结果)。实验在2023年至2024年样本外期间,使用8只流动性美国ETF、4种模型外加两阶段提示(共40个策略)进行。主要发现有三点:第一,一致性并不预测盈利能力——40个策略中只有2个跑赢买入持有,且简单的sma(50,200)规则在平均夏普比率上优于所有模型生成策略;第二,自我评估严重失准——40个策略中有32个声称跑赢买入持有,而实际仅1个做到;第三,将语言-代码评判器替换为第二模型时,超过一半项目的say-to-do结果发生翻转。此外,向代码中注入Close.shift(-1)(未来信息)使do-to-real平均下降0.33,但运行时未来信息探针在干净和注入代码上均未触发。作者强调FIDES是用于测量忠实度的协议,而非关于市场表现的断言。
💡 推荐理由: 为LLM生成交易策略的可信度提供了系统性验证方法,揭示语言承诺与代码事实的严重脱节,对依赖AI做金融决策或审计AI输出的安全从业者具有直接警示意义。
🎯 建议动作: 研究跟进
排序因子: 影响边界/网络设备 (+5) | 来自 arXiv 其他板块 (+2) | 命中热门研究主题 (+2) | Community 数据源 (+1) | LLM 评分加成 (+0.5)