本研究针对众包平台(如Prolific和Mechanical Turk)上调查问卷参与者越来越多使用大型语言模型(LLM)辅助回答的现象,旨在量化这种行为的普遍性并探索检测与缓解方法。研究团队开展了一系列调查(样本量N=250),系统评估了平台选择、调查长度、明确要求不使用AI、以及禁用复制粘贴功能等条件对LLM使用频率的影响。通过分析回答的文本特征(如语言风格、一致性、错误模式等),研究人员成功识别出LLM辅助回答的独特特征,并发现其使用频率在不同平台间差异显著:在Prolific上低于10%,而在Mechanical Turk上超过80%。缓解措施(如禁用复制粘贴、加入不适用AI的请求)虽降低了LLM的使用率,但并未显著提高数据质量,暗示部分真实回答也被错误过滤。此外,研究期间未观察到参与者使用浏览器自动化代理(browser-use agents)的现象,但作者分享了基于按键记录和回答模式分析的检测实验。最终建议研究人员在数据收集阶段主动记录和分析按键数据,并设计针对AI的指令和问题,以更有效地筛选出LLM生成的回答。该研究首次系统量化了众包调查中LLM使用的规模与检测有效性,为人机交互和计算社会科学领域提供了重要参考。
💡 推荐理由: 随着LLM在众包平台上的滥用,调查数据的有效性受到严重威胁。该研究首次量化了LLM使用的真实比例,并提出了实用的检测与缓解方法,对依赖众包数据的社会科学、市场调研和用户研究从业者至关重要。
🎯 建议动作: 研究跟进