![]()
這句話,出自全球AI領(lǐng)域最不該被忽視的那個(gè)人。
7月17日,2026世界人工智能大會(huì)(WAIC)主論壇,2024年圖靈獎(jiǎng)得主、"強(qiáng)化學(xué)習(xí)之父"理查德·薩頓登臺(tái)發(fā)表主旨演講。全場(chǎng)坐滿了追捧大模型的從業(yè)者和投資人,而薩頓給這個(gè)熱鬧的房間澆了一盆冷水:當(dāng)前的大模型,并不具備原生智能。它們能做的,本質(zhì)上是在人類(lèi)歷史數(shù)據(jù)中進(jìn)行模式匹配,和真正意義上的智能之間,還差著一道根本性的鴻溝。
薩頓的核心論點(diǎn)并不復(fù)雜,但在當(dāng)前的產(chǎn)業(yè)氛圍里,卻顯得格外刺耳。
他將當(dāng)下的AI發(fā)展階段定義為"人類(lèi)數(shù)據(jù)時(shí)代":大型語(yǔ)言模型的訓(xùn)練邏輯,是預(yù)測(cè)人類(lèi)語(yǔ)言的下一個(gè)詞,本質(zhì)上是對(duì)海量人類(lèi)書(shū)寫(xiě)記錄的統(tǒng)計(jì)擬合。這套范式在過(guò)去幾年里制造了令人震驚的能力涌現(xiàn),GPT-4、Claude、Gemini們能寫(xiě)代碼、能做分析、能聊天,看上去無(wú)所不能。
這正是他所說(shuō)的"大模型不具備原生智能"的實(shí)質(zhì)含義。識(shí)別模式不等于產(chǎn)生思想,預(yù)測(cè)下一個(gè)詞不等于理解世界。
薩頓提出的替代路徑,是他畢生研究的方向:強(qiáng)化學(xué)習(xí),以及以此為基礎(chǔ)的"經(jīng)驗(yàn)時(shí)代"。
他在演講中多次提到,真正的智能應(yīng)該像嬰兒一樣習(xí)得,而不是像學(xué)生一樣被灌輸。嬰兒剛出生時(shí),對(duì)世界一無(wú)所知,但他們通過(guò)與環(huán)境的持續(xù)互動(dòng),通過(guò)試錯(cuò)、反饋和修正,逐漸建立起對(duì)世界的理解和應(yīng)對(duì)能力。這個(gè)過(guò)程中,沒(méi)有人預(yù)先給他們貼好標(biāo)簽,告訴他們每一步該怎么做。
這正是強(qiáng)化學(xué)習(xí)的基本邏輯:AI智能體在環(huán)境中行動(dòng),根據(jù)行動(dòng)的結(jié)果獲得獎(jiǎng)懲信號(hào),并據(jù)此調(diào)整策略,這個(gè)過(guò)程循環(huán)往復(fù),直到找到最優(yōu)行為方式。AlphaGo和AlphaZero證明了這條路在特定領(lǐng)域可以產(chǎn)生超越人類(lèi)的能力,而且這種能力并非來(lái)自模仿人類(lèi)棋手,而是來(lái)自數(shù)以?xún)|計(jì)次的自我對(duì)弈經(jīng)驗(yàn)。
這個(gè)判斷并非沒(méi)有爭(zhēng)議。當(dāng)前大模型陣營(yíng)并不認(rèn)為兩條路徑是非此即彼的關(guān)系,不少研究者認(rèn)為將語(yǔ)言模型與強(qiáng)化學(xué)習(xí)結(jié)合,正是通向更強(qiáng)AI的實(shí)際方向,DeepSeek-R1、OpenAI的o系列模型在推理能力上的突破,部分正是借助了強(qiáng)化學(xué)習(xí)的思路。
但薩頓要強(qiáng)調(diào)的,顯然是一個(gè)更根本的方向性判斷:如果不在智能體如何獲取經(jīng)驗(yàn)這個(gè)底層問(wèn)題上實(shí)現(xiàn)突破,僅靠現(xiàn)有范式的迭代,AI將原地踏步。
在上海這個(gè)全球最熱鬧的AI展場(chǎng),這句話聽(tīng)起來(lái)像是煞風(fēng)景。但對(duì)于這個(gè)領(lǐng)域而言,這樣的聲音,恰恰是最需要的那種清醒。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.