![]()
認知神經(jīng)科學前沿文獻分享
基本信息
Title:Large language models can predict the results of social science experiments
發(fā)表時間:2026-07-08
發(fā)表期刊:Nature
影響因子:56.1
獲取原文:
1. 添加小助手:PSY-Brain-Frontier即可獲取PDF版本
![]()
研究背景
大型語言模型(large language models, LLMs)已經(jīng)能模仿很多人類語言反應,但社會科學實驗看的不是單個回答像不像人,而是隨機條件之間的處理效應(treatment effects)。這篇 Nature 論文問的是一個更窄也更難的問題:模型在看到人口學特征、實驗刺激和結(jié)果問題后,能不能預測美國社會科學實驗中真實樣本的效應大小排序,而不是復述論文結(jié)果,或假裝生成一名受訪者的答案
實驗設計與方法邏輯
作者讓 GPT-4 等模型扮演不同人口學特征的美國參與者,在各實驗條件下作答,再用條件均值計算 LLM-derived predictions。主要檔案包括 70 個預注冊、全國代表性調(diào)查實驗、469 個效應和 119,330 名參與者;補充檔案包括 15 個大型多處理實驗(megastudies)、606 個效應。評估指標有相關、調(diào)整相關(adjusted correlation, r_adj)、誤差、校準斜率。論文還把模型預測與人類、專家預測作比較,并討論可能用途、偏差和誤用風險
核心發(fā)現(xiàn)
發(fā)現(xiàn)一:GPT-4 對主要調(diào)查實驗的效應排序預測很強
在 70 個美國文本型社會科學調(diào)查實驗中,GPT-4 預測效應與真實效應高度相關,r = 0.85,r_adj = 0.92;較新模型和若干開源權(quán)重模型也有不錯表現(xiàn)。主要問題在絕對數(shù)值:模型預測的效應大約是真實效應的兩倍,存在系統(tǒng)性高估(systematic overestimation)![]()
Fig. 1 展示了 LLM 預測處理效應與原始處理效應的對應關系,也比較了不同模型和研究子集的相關性。模型能分出較大和較小效應,但原始尺度需要重新校準發(fā)現(xiàn)二:未公開研究中仍有高相關,但訓練數(shù)據(jù)泄漏不能完全排除
對 GPT-4 訓練數(shù)據(jù)截止前未發(fā)表或未公開的研究,模型預測仍保持高相關;截至 2025 年 6 月仍未發(fā)表的研究也呈現(xiàn)類似模式。這讓“模型只是記住已發(fā)表結(jié)果”的解釋變?nèi)趿?/p>
Fig. 1 的穩(wěn)健性分析顯示,未公開或較晚公開研究子集仍有較高預測相關。這說明 LLM 對新實驗效應含有預測信息,但不能證明訓練數(shù)據(jù)影響為零發(fā)現(xiàn)三:在 megastudies 中表現(xiàn)下降,但與專家預測量級相近
在 15 個 megastudies 的 606 個效應中,LLM 預測與真實效應的總體相關降至 r = 0.39、r_adj = 0.48,低于主要調(diào)查實驗檔案。它表現(xiàn)較好的場景仍然是文本處理和調(diào)查結(jié)果;遇到非文本處理、現(xiàn)場行為結(jié)果和小效應時,預測難度明顯上升![]()
Fig. 2 比較了 LLM 與專家預測在 megastudies 中的相關性。LLM 可以作為額外預測來源,但它的適用范圍受實驗材料和結(jié)果類型限制發(fā)現(xiàn)四:校準后有輔助價值,也帶來偏差和誤用風險
重新校準后,LLM 預測可以輔助 pilot testing、識別可能需要復制的效應,并小幅提升專家選擇干預的表現(xiàn)。但問題也很清楚:模型在部分群體上的準確性有小差異,對 white 和 Republican 樣本更有利;疫苗相關 Facebook 帖子的分析還顯示,模型可能被用來篩選會降低接種意愿的內(nèi)容![]()
Fig. 3 展示了 pilot testing、復制篩查、專家增強選擇和社會科學家使用意愿。潛在科研用途、校準要求、偏差和誤用邊界,都被放在同一組證據(jù)里討論
省流總結(jié)
這篇 Nature 正刊論文顯示,LLM 對美國文本型社會科學調(diào)查實驗的處理效應排序有較強預測力;到了 megastudies,表現(xiàn)變?nèi)酰杂醒a充價值。它不能替代真人實驗:絕對效應會被系統(tǒng)性高估,適用范圍有限,還伴隨偏差、復現(xiàn)性和有害使用風險
分享人:天天
審核:PsyBrain 腦心前沿編輯部
你好,這里是「PsyBrain 腦心前沿」
專注追蹤全球認知神經(jīng)科學的最尖端突破
視野直擊 Nature, Science, Cell 正刊 及核心子刊與頂級大刊
每日速遞「深度解讀」與「前沿快訊」
科研是一場探索未知的長跑,但你無需獨行。歡迎加入PsyBrain 學術社群,和一群懂你的同行,共同丈量腦與心智的無垠前沿。
點擊卡片進群,歡迎你的到來
一鍵關注,點亮星標 ? 前沿不走丟!
![]()
一鍵分享,讓更多人了解前沿
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.