跳到正文
InsightXiv
InsightXiv
AI 研究助手 · AI Research Assistant
未登录浏览
专题解读 · Nature

大型语言模型可预测社科实验结果

原始标题:Large language models can predict the results of social science experiments
《自然》(2026)引用本文
返回首页

AI 摘要

  • 把 LLM 放进社会科学实验设计流程,检验它能否提前预判干预效果
  • 这篇 Nature 论文检验大语言模型能否在实验真正运行前预测社会科学实验结果。作者围绕美国成年人样本中的文本干预实验,让模型预测处理效应,并与真实实验和人类专家预测对比;结果显示模型在不少实验上能给出有用预测,但在复杂社会议题、伦理困境和...
  • 社会科学实验往往成本高、反馈慢,如果模型能在实验前提供可靠预测,就可能帮助研究者更快筛掉弱假设。
  • 评估 LLM 是否能预测社会科学文本干预实验的结果,以及这种预测在研究设计中应如何使用。

中文译文

大型语言模型(LLM)如何推动社会与行为科学的发展,正引发日益浓厚的兴趣。此前研究已评估过LLM预测调查回答的能力,但对其能否预测社会科学实验的结果——尤其是训练数据中未包含的实验结果——仍知之甚少。为此,我们构建了一个包含70项预先注册、具有美国全国代表性的调查实验档案库,涉及469个实验效应和119,330名参与者。我们引导LLM模拟美国个体代表性样本对实验刺激的反应,并通过比较不同条件下的模拟反应来推断处理效应。GPT-4(其训练数据截止日期早于我们档案库中许多研究的发表时间)得出的预测与实际处理效应高度相关,其准确度与人类集体预测相当。对于模型训练数据截止日期前未发表或未公开的研究,以及来自知名开源权重模型的预测,相关性依然保持较高水平。尽管相关性很高,但预测系统性地高估了效应量。在包含606个效应的15项大型研究的次级档案库中,相关性虽有所降低,但仍与专家集体预测的水平相当。为评估其对科学实践的影响,我们调查了460位社会科学家关于可能用途和感知风险的看法,并利用我们的档案库评估了若干应用场景(试点测试、干预选择、识别需复制的效应)及风险(偏见、滥用)。这些结果共同表明,LLM能够增强科学与实践中的实验方法,同时也为负责任的使用提出了重要考量。

这是订阅内容的预览,请通过您的机构访问。

访问《自然》及另外54本《自然》系列期刊。

获取Nature+,这是我们最具性价比的在线访问订阅服务。

价格可能需加收当地税费,具体金额将在结账时计算。

本文使用的所有数据均可从 https://codeocean.com/capsule/9843791/tree/v1 获取。所有研究材料均可在补充信息中查阅。源数据随本文一同提供。

重现结果的代码可在 https://codeocean.com/capsule/9843791/tree/v1 获取。我们也邀请研究人员在我们的网络演示(https://treatmenteffect.app/)中试用该模型,该演示使用本文详述的方法生成基于AI的实验效应预测。

Bail, C. A. 生成式AI能否改善社会科学?《美国国家科学院院刊》121, e2314021121 (2024).

Grossmann, I. 等人,《AI与社会科学研究的变革》,《科学》第380卷,第1108–1109页(2023年)。

Luo, X. 等人著。大型语言模型在预测神经科学结果方面超越人类专家。《自然·人类行为》第9卷,第305–315页(2025年)。

Abdurahman, S. 等人,《在心理学研究中使用大型语言模型的危险与机遇》,《PNAS Nexus》第3卷,pgae245(2024年)。

Argyle, L. P. 等人,《从一中生多:利用语言模型模拟人类样本》,《政治分析》第31卷,第337–351页(2023年)。

Dillion, D., Tandon, N., Gu, Y. & Gray, K. 人工智能语言模型能否取代人类参与者?《认知科学趋势》27, 597–600 (2023)。

Filippas, A., Horton, J. J. & Manning, B. S. 将大语言模型作为模拟经济智能体:我们能从“硅基人”身上学到什么?载于《第25届ACM经济学与计算会议论文集》第614–615页(ACM, 2024年)。

Binz, M. 与 Schulz, E. 利用认知心理学理解 GPT-3。《美国国家科学院院刊》120, e2218523120 (2023)。

Hackenburg, K. 等人著,《对话式人工智能的政治说服杠杆》,《科学》390卷,eaea3884号(2025年)。

Meta基础人工智能研究外交团队(FAIR)等。通过将语言模型与战略推理相结合,在外交游戏中实现人类水平的对弈。《科学》378, 1067–1074 (2022)。

Park, J. S. 等人,《生成式智能体:人类行为的交互式模拟》。载于《第36届ACM用户界面软件与技术年度研讨会论文集》(Follmer, S. 等人编),第1–22页(ACM,2023年)。

Yin, Y., Jia, N. & Wakslak, C. J. 研究表明,AI可以帮助人们感到被倾听,但AI标签会削弱这种效果。《美国国家科学院院刊》121, e2319112121 (2024)。

Lehr, S. A., Caliskan, A., Liyanage, S. & Banaji, M. R. 《ChatGPT作为研究科学家:探究GPT作为研究图书馆员、研究伦理学家、数据生成器和数据预测器的能力》。《美国国家科学院院刊》121, e2404328121 (2024)。

Coppock, A., Leeper, T. J. 和 Mullinix, K. J. 异质性处理效应估计值在不同样本间的可推广性。《美国国家科学院院刊》115, 12441–12446 (2018)。

Chang, S., Kennedy, A., Leonard, A. & List, J. A. 《在实验研究中利用生成式AI的12项最佳实践》(美国国家经济研究局,2024年)。

Broska, D., Howes, M. & van Loon, A. 混合主体设计:将大型语言模型视为潜在信息性观察。社会学方法研究 54, 1074–1109 (2025)。

Chu, J. Y. 等人著。在预测旨在强化民主态度的干预措施时,学者更为具体,而实践者更为敏感。《美国国家科学院院刊》121卷,e2307008121(2024年)。

DellaVigna, S. 与 Linos, E. 大规模随机对照试验:来自两个助推单位的综合证据。《计量经济学》90卷,81–116页(2022年)。

Dreber, A. 等人利用预测市场评估科学研究的可重复性。《美国国家科学院院刊》112, 15343–15347 (2015)。

Milkman, K. L. 等人著,《大规模研究提升应用行为科学的影响力》,《自然》第600卷,第478–483页(2021年)。

Messeri, L. & Crockett, M. J. 人工智能与科学研究中的理解幻觉。《自然》627, 49–58 (2024)。

Binz, M. 等人提出了一种基础模型,用于预测和捕捉人类认知。《自然》644, 1002–1009 (2025)。

Tjuatja, L., Chen, V., Wu, T., Talwalkwar, A. & Neubig, G. 大型语言模型是否表现出类似人类的反应偏差?一项关于调查设计的案例研究。《计算语言学协会汇刊》12, 1011–1026 (2024)。

陈、Y.,胡、Y.,与卢、Y. 利用大型语言模型预测实地实验。预印本发布于 https://arxiv.org/abs/2504.01167 (2025)。

Wang, X. 等人提出,自洽性改进了语言模型中的思维链推理。载于《第十一届国际学习表征会议论文集》(海报展示)(ICLR,2023年)。

Arora, S. 等人著《问我任何问题:一种简单的语言模型提示策略》,载于第十一届国际学习表征会议论文集(ICLR,2023年)。

Voronov, A., Wolf, L. & Ryabinin, M. 注意格式:迈向上下文学习改进的一致评估。载于《计算语言学协会发现:ACL 2024》(Ku, L.-W. 等编)第6287–6310页(ACL, 2024)。

开放科学合作项目。评估心理科学的可重复性。《科学》349, aac4716 (2015)。

Milkman, K. L. 等人,《大规模研究显示提醒能促进疫苗接种,但增加免费乘车服务则不然》,《自然》631, 179–188 (2024)。

Milkman, K. L. 等人进行了一项涉及68万人的大型研究,探讨如何通过助推手段鼓励人们在药房接种疫苗。该研究发表于《美国国家科学院院刊》第119卷,文章编号e2115126119(2022年)。

Zickfeld, J. H. 等人著,《事前诚实宣誓在减少不诚实行为中的有效性取决于其内容》,《自然·人类行为》第9卷,第169–187页,2025年。

Broockman, D. E., Kalla, J. L., Caballero, C. & Easton, M. 政治从业者难以准确预测哪些信息能够说服公众。《美国国家科学院院刊》121, e2400076121 (2024)。

DellaVigna, S. 与 Vivalt, E. 合著《预测社会科学:来自100个项目的证据》。美国国家经济研究局,https://doi.org/10.3386/w34493 (2025)。

DellaVigna, S. & Pope, D. 《什么激励了努力?证据与专家预测》。《经济研究评论》85, 1029–1069 (2018)。

Vlasceanu, M. 等人著《用行为科学应对气候变化:一项覆盖63个国家的全球干预竞赛》,载于《科学进展》第10卷,eadj5778号(2024年)。

Voelkel, J. G. 等人进行了一项大规模研究,测试了25种减少反民主态度和党派敌意的处理方法。《科学》杂志386卷,eadh4764号(2024年)。

Voelkel, J. G. 等人,《一项关于被引用最多的气候信息说服力的注册报告大型研究》,《自然·气候变化》第16卷,第214–225页,2026年。

Saccardo, S. 等人,《实地测试行为科学知识在促进疫苗接种方面的可迁移性》,《自然·人类行为》第8卷,第878–890页(2024年)。

Mason, K. 等人著《2024年美国总统大选前增加选民登记的行为干预措施大型研究》,预印本发表于PsyArXiv,网址:https://doi.org/10.31234/osf.io/p6b2e_v3 (2025)。

Goldwert, D. 等人,《一项关于促发公众、政治和金融气候倡导行为干预的大型研究》,PNAS Nexus 5, pgaf400 (2026)。

Druckman, J. N. 《实验思维》(剑桥大学出版社,2022年)。

Freese, J. & Peterson, D. 社会科学中的重复研究. 《社会学年度评论》 43, 147–165 (2017).

Bai, X., Wang, A., Sucholutsky, I. & Griffiths, T. L. 明确无偏的大语言模型仍会形成有偏关联。《美国国家科学院院刊》122, e2416228122 (2025)。

Wang, A., Morgenstern, J. 和 Dickerson, J. P. 指出,取代人类参与者的大型语言模型可能会有害地歪曲并扁平化身份群体。《自然·机器智能》第7卷,第400–411页(2025年)。

Frank, M. C. 公开可访问的大语言模型有助于我们理解人类认知。《自然·人类行为》7, 1825–1827 (2023)。

Almaatouq, A. 等人,《超越与自然的二十问游戏:社会与行为科学中的整合性实验设计》,《行为与脑科学》47, e33 (2024)。

Tyner, A. H. 等人,《调查社会与行为科学的可重复性》,《自然》652, 143–150 (2026)。

Cummins, J. 使用大型语言模型模拟人类数据时分析灵活性的威胁:呼吁关注。预印本,https://arxiv.org/abs/2509.13397 (2025)。

Coppock, A. 在机械土耳其人上进行的调查实验的推广:一种复制方法。《政治科学研究方法》7, 613–628 (2019)。