![]()
同一個(gè)回答,在摘要任務(wù)里算幻覺(jué),在開(kāi)放域問(wèn)答里卻不一定是 —— 大模型 “幻覺(jué)” 研究的分裂,到了連 “什么是幻覺(jué)” 都無(wú)法達(dá)成共識(shí)的地步。在第一篇 ICML 2026 Position Paper 中,研究者們給出了一個(gè)直截了當(dāng)?shù)幕卮穑罕康埃糜X(jué)的問(wèn)題在于大模型內(nèi)部的 “世界模型” 認(rèn)知(It‘s The World Model, Stupid!)
![]()
- ICML2026 Position Paper:We Need A Unified Definition of Hallucination (It’s The World Model, Stupid!)
- 論文鏈接:https://arxiv.org/abs/2512.21577
- Follow-up Bechmark Paper: HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models
- 論文鏈接:https://arxiv.org/abs/2605.19341
一個(gè)福爾摩斯問(wèn)題,
暴露了領(lǐng)域的概念裂縫
論文以一道看似簡(jiǎn)單的問(wèn)題開(kāi)場(chǎng):給定上下文明確寫(xiě)著 “Sherlock Holmes 住在倫敦貝克街 221B 號(hào)”,模型卻回答 “福爾摩斯是虛構(gòu)人物,沒(méi)有現(xiàn)實(shí)地址”—— 這算不算幻覺(jué)?
在摘要研究者眼中,模型公然違背了源文檔,毫無(wú)疑問(wèn)構(gòu)成幻覺(jué);在開(kāi)放域問(wèn)答研究者眼中,這句話在現(xiàn)實(shí)事實(shí)層面成立,甚至可能被視為更謹(jǐn)慎的回答。
同一段輸出,兩套任務(wù)假設(shè),兩種相反判定。
這不是某個(gè)邊緣案例的疏漏,而是幻覺(jué)研究長(zhǎng)期以來(lái)的結(jié)構(gòu)性困境。機(jī)器翻譯和摘要關(guān)心 source faithfulness,開(kāi)放域問(wèn)答關(guān)心 factuality,RAG 系統(tǒng)需要處理檢索內(nèi)容與參數(shù)記憶之間的沖突,而 Agent 場(chǎng)景又要求模型正確理解一個(gè)持續(xù)變化的環(huán)境狀態(tài)。大家共享同一個(gè)術(shù)語(yǔ) “幻覺(jué)”,背后卻默認(rèn)了不同的真值錨點(diǎn)。
因此,“我們將幻覺(jué)降低了 40%” 并非沒(méi)有意義,但它必須附帶一組明確的限定:相對(duì)于哪個(gè)參考世界?模型看到了什么?證據(jù)沖突時(shí)誰(shuí)優(yōu)先?如果這些前提沒(méi)有跨任務(wù)對(duì)齊,我們就很難判斷一種緩解方法究竟解決了什么,也難以預(yù)測(cè)它能否遷移到新的應(yīng)用場(chǎng)景。
當(dāng) “什么算幻覺(jué)” 無(wú)法被共同說(shuō)明時(shí),不同 benchmark 的分?jǐn)?shù)就很難進(jìn)入同一場(chǎng)學(xué)術(shù)對(duì)話。
統(tǒng)一框架:
把評(píng)測(cè)中被省略的前提寫(xiě)進(jìn)公式
這篇被 ICML 2026 Position Track 接收的論文,切入點(diǎn)并不是再追加一套更細(xì)的分類(lèi)法。作者團(tuán)隊(duì)的判斷是:領(lǐng)域并不缺少有效的局部定義,真正缺少的是一個(gè)能夠容納這些定義,并說(shuō)明它們何時(shí)可比、何時(shí)不可比的共同語(yǔ)法。
為此,論文將幻覺(jué)概括為:模型輸出中可被用戶觀察到的、相對(duì)于指定參考世界的不準(zhǔn)確世界建模。隨后,作者引入?yún)⒖际澜缒P停≧eference World Model)的形式化定義:
W = (S, H, R)
其中,S 表示可能的世界狀態(tài),H 表示交互歷史,R 表示狀態(tài)與歷史必須滿足的規(guī)則。關(guān)鍵在于,這里的 W 并不是對(duì)神經(jīng)網(wǎng)絡(luò)內(nèi)部表征的武斷推測(cè),而是一個(gè)用于判定當(dāng)前任務(wù)中 “什么為真” 的指定參照結(jié)構(gòu)。它可以是一篇源文檔、一個(gè)知識(shí)庫(kù)、一棵 DOM 樹(shù),也可以是一盤(pán)棋、一個(gè)模擬器或一段可執(zhí)行程序。
W 也不必是一個(gè)宏大而完備的 “現(xiàn)實(shí)世界”。在開(kāi)放域任務(wù)中,它可以是有邊界、可版本化的知識(shí)源;在 Agent 場(chǎng)景中,它則可以由當(dāng)前環(huán)境狀態(tài)、歷史軌跡與可執(zhí)行規(guī)則共同組成。
僅有 W 仍然不夠。論文進(jìn)一步指出,一項(xiàng)可復(fù)現(xiàn)的幻覺(jué)評(píng)測(cè)必須顯式回答三個(gè)長(zhǎng)期被隱含處理的問(wèn)題:
- V(視圖函數(shù)):模型在當(dāng)前輸入下能夠看到參考世界的哪一部分?
- P(沖突策略):當(dāng)多個(gè)信息源 —— 例如檢索文檔與參數(shù)記憶 —— 發(fā)生矛盾時(shí),誰(shuí)優(yōu)先?
- T(真值函數(shù)):給定 W 和 P,一個(gè)原子命題應(yīng)被判為 true、false,還是 unknown?
由此,統(tǒng)一定義可以寫(xiě)成:如果模型輸出中存在一個(gè)用戶可觀察的原子命題 c,并且它在給定參考世界與沖突策略下為 false,那么該輸出相對(duì)于 (W, P) 構(gòu)成幻覺(jué)。
? c ∈ C (y) : T (W,P)(x, c) = false
![]()
圖 1|統(tǒng)一定義框架:參考世界 W、視圖函數(shù) V、沖突策略 P 與真值函數(shù) T 共同決定一個(gè)可觀察命題是否構(gòu)成幻覺(jué)。
這一定義最顯著的概念貢獻(xiàn),是把過(guò)去隱含在各類(lèi) benchmark 設(shè)計(jì)中的選擇變成顯式對(duì)象:摘要任務(wù)把源文檔設(shè)為 W;開(kāi)放域問(wèn)答把有邊界的知識(shí)源設(shè)為 W;RAG 必須聲明檢索文檔是否覆蓋參數(shù)記憶;網(wǎng)頁(yè) Agent 則把當(dāng)前 DOM、操作歷史與環(huán)境規(guī)則共同視作 W。
![]()
圖 2|摘要、開(kāi)放域問(wèn)答、RAG 與 Agent 場(chǎng)景,可以被視為同一模板下對(duì) W、V 和 P 的不同實(shí)例。
不是所有錯(cuò)誤都叫幻覺(jué)
該框架帶來(lái)的一個(gè)直接且重要的辨析,是將 “幻覺(jué)” 與更寬泛的 “模型錯(cuò)誤” 區(qū)分開(kāi)來(lái)。
若 Agent 準(zhǔn)確看到了頁(yè)面上的按鈕,卻選擇了低效動(dòng)作,這是 planning error;若它堅(jiān)稱(chēng)頁(yè)面上存在一個(gè) DOM 中根本不存在的 “submit-btn”,這才是對(duì)環(huán)境狀態(tài)形成了錯(cuò)誤信念。前者是 “做錯(cuò)了”,后者是 “假定了一個(gè)并不存在的世界”。
類(lèi)似地,模型在證據(jù)不足時(shí)選擇拒答,可能沒(méi)有完成任務(wù),但它并沒(méi)有編造虛假狀態(tài),因此不應(yīng)自動(dòng)歸為幻覺(jué);模型正確理解了環(huán)境,卻沒(méi)有遵循用戶目標(biāo),則更接近 instruction-following error。
這套分解也讓緩解策略的作用位置更清楚:檢索與更豐富的環(huán)境觀測(cè)主要改變 V,讓模型獲得更多證據(jù);沖突規(guī)則與外部驗(yàn)證器明確或?qū)崿F(xiàn) P/T 的判定過(guò)程;校準(zhǔn)與拒答訓(xùn)練改變模型在不確定時(shí)的輸出行為;而一部分訓(xùn)練或架構(gòu)干預(yù),才直接面向模型對(duì) W 的內(nèi)部近似。
于是,研究者可以進(jìn)一步追問(wèn):一種具體的方法是究竟讓模型 “看得更多”、讓判定 “更可靠”,還是讓世界建模本身 “更準(zhǔn)確”?這比只報(bào)告一個(gè)總幻覺(jué)率更有診斷價(jià)值。
從定義到實(shí)驗(yàn):
國(guó)際象棋為何是一座 “橋”
一個(gè)定義是否真正具備生產(chǎn)力,最終取決于它能否落地為可復(fù)現(xiàn)、可擴(kuò)展的實(shí)驗(yàn)設(shè)計(jì)。
論文用國(guó)際象棋給出了一個(gè)簡(jiǎn)潔的范例。棋盤(pán)狀態(tài)與走子歷史天然構(gòu)成 W,規(guī)則集 R 定義合法移動(dòng);通過(guò)控制模型可見(jiàn)的信息 —— 完整棋盤(pán)、PGN 走子記錄或自然語(yǔ)言評(píng)述 —— 研究者可以精確操縱 V;而模型輸出中每個(gè)關(guān)于棋局的可檢查命題,都可以由棋類(lèi)引擎自動(dòng)判定為 true 或 false。
![]()
![]()
圖 3|國(guó)際象棋將參考世界、可見(jiàn)信息與自動(dòng)真值判定連接起來(lái);下圖示意模型預(yù)測(cè)的棋局與真實(shí)棋局之間的失配
對(duì)于這類(lèi)結(jié)構(gòu)化世界,幻覺(jué)標(biāo)簽可以由環(huán)境本身 “按構(gòu)造給出”,無(wú)需再調(diào)用另一個(gè) LLM 充當(dāng)裁判,也不必依賴(lài)事后的人類(lèi)自由判斷。模型聲稱(chēng) “白方可以一步吃掉黑后”,但引擎顯示中間有棋子阻擋 —— 這里評(píng)測(cè)的并非棋力高低,而是一個(gè)可觀察命題是否與參考世界的狀態(tài)和規(guī)則相沖突。
國(guó)際象棋在這里的重要性遠(yuǎn)不止一個(gè)演示場(chǎng)景。它清楚展示了統(tǒng)一定義如何依次導(dǎo)出可控環(huán)境、視圖函數(shù)與自動(dòng)真值判定,并最終發(fā)展為一套系統(tǒng)的評(píng)測(cè)框架。
HalluWorld:
把統(tǒng)一定義壓進(jìn)可擴(kuò)展的基準(zhǔn)
沿著上述思路,團(tuán)隊(duì)進(jìn)一步推出HalluWorld:一個(gè)將統(tǒng)一定義操作化為可控評(píng)測(cè)的基準(zhǔn)框架。它覆蓋三類(lèi)環(huán)境:
- Grid Worlds(33 個(gè)關(guān)卡,839 個(gè)探針):完全合成、可定制的環(huán)境,可獨(dú)立操縱世界復(fù)雜度、可觀察范圍、輸入表示與動(dòng)態(tài)機(jī)制。
- Chess(7 個(gè)關(guān)卡,350 個(gè)探針):規(guī)則明確、可自動(dòng)驗(yàn)證,同時(shí)又是訓(xùn)練數(shù)據(jù)中廣泛存在的領(lǐng)域,可測(cè)試模型在強(qiáng)先驗(yàn)下是否仍忠實(shí)于當(dāng)前棋局。
- Terminal Tasks(110 個(gè)任務(wù),529 個(gè)探針):基于真實(shí) Linux 終端軌跡,模擬長(zhǎng)時(shí)程 Agent 在高噪聲、部分可觀測(cè)環(huán)境中的部署場(chǎng)景。
整個(gè)基準(zhǔn)圍繞感知、記憶、因果、不確定性與復(fù)合推理五類(lèi)能力組織探針;其中 Chess 因當(dāng)前棋盤(pán)狀態(tài)完全可觀測(cè),不單獨(dú)設(shè)置不確定性探針。三類(lèi)環(huán)境都明確給出參考世界、模型可見(jiàn)的信息與可計(jì)算的真值,最終評(píng)分采用規(guī)則式判斷,而不是 LLM-as-a-judge
![]()
圖 4|HalluWorld 覆蓋 Grid Worlds、Chess 與 Terminals,并以五類(lèi)探針診斷不同認(rèn)知失敗。
實(shí)驗(yàn)結(jié)果沒(méi)有給出一個(gè)簡(jiǎn)單的 “誰(shuí)最好”。更有啟發(fā)性的是,不同類(lèi)別的幻覺(jué)呈現(xiàn)出明顯不同的能力曲線。
看得見(jiàn),不等于跟得上。在 HalluWorld 上,前沿模型對(duì)當(dāng)前觀測(cè)中直接可見(jiàn)信息的讀取已接近飽和;但一旦任務(wù)要求跨多步維護(hù)狀態(tài),或模擬動(dòng)作將如何改變未來(lái)世界,幻覺(jué)率仍會(huì)明顯上升。模型可能看清了當(dāng)前場(chǎng)景,卻沒(méi)有持續(xù)維護(hù)一個(gè)一致的世界狀態(tài)。
想得更久,不一定更忠實(shí)。在 Grid Worlds 的因果探針上,增加推理預(yù)算并未帶來(lái)穩(wěn)定收益。例如,Claude Sonnet 4.6 的因果幻覺(jué)率從無(wú) thinking 時(shí)的 19.7%,上升到 thinking 最大預(yù)算下的 27.1%。一種可能的解釋是:開(kāi)放式前向模擬給了模型更多生成 “看似合理、卻未受環(huán)境狀態(tài)約束” 的中間步驟的機(jī)會(huì)。
![]()
最難說(shuō)出口的,仍是 “無(wú)法確定”。在真實(shí)終端軌跡中,即使表現(xiàn)最好的模型,當(dāng)正確答案應(yīng)為 “無(wú)法從現(xiàn)有上下文判斷” 時(shí),仍有約 23.1% 的回答會(huì)作出過(guò)度確定的斷言。模型經(jīng)常把 “我沒(méi)有找到證據(jù)” 寫(xiě)成 “已有證據(jù)證明不存在”;在真實(shí) Agent 系統(tǒng)中,后者很可能成為后續(xù)行動(dòng)的錯(cuò)誤前提。
這些發(fā)現(xiàn)說(shuō)明,把幻覺(jué)統(tǒng)一壓縮為一個(gè) “總幻覺(jué)率” 會(huì)掩蓋關(guān)鍵的質(zhì)性差異。一個(gè)模型可能在靜態(tài)感知題上接近滿分,卻在長(zhǎng)程記憶中系統(tǒng)性失穩(wěn);可能在事實(shí)問(wèn)答中可靠,卻在動(dòng)態(tài)環(huán)境里編造下一步狀態(tài)。不同失敗需要不同的診斷工具與干預(yù)策略,而不應(yīng)被一個(gè)總分抹平。
結(jié)語(yǔ):模型不需要全知,
但需要認(rèn)識(shí)自己的證據(jù)邊界
這篇 ICML 2026 Position Paper 的貢獻(xiàn),并不是又一種消除幻覺(jué)的微調(diào)技巧,而是為 “幻覺(jué)” 從一個(gè)寬泛的日常標(biāo)簽轉(zhuǎn)變?yōu)榭刹僮鳌⒖杀容^、可測(cè)量的研究對(duì)象,提供了一套明確的形式化語(yǔ)言。HalluWorld 則進(jìn)一步展示,這套語(yǔ)言可以被轉(zhuǎn)化為可控制、可復(fù)現(xiàn)的實(shí)驗(yàn)程序。
作者團(tuán)隊(duì)并未宣稱(chēng)大模型必須擁有完美的內(nèi)部世界模型。事實(shí)上,人類(lèi)也會(huì)不知道、誤解和遺忘,也需要查閱資料、承認(rèn)不確定,并根據(jù)新證據(jù)修正判斷。目標(biāo)不是讓模型成為全知者,而是讓系統(tǒng)設(shè)計(jì)者明確參考世界與沖突規(guī)則,讓模型在證據(jù)邊界內(nèi)作答,并在信息不足時(shí)保留 unknown,而不是補(bǔ)出一個(gè)看似完整的世界。
隨著大模型從一次性問(wèn)答走向長(zhǎng)時(shí)程 Agent,靜態(tài)的 “事實(shí)正確率” 已經(jīng)不足以刻畫(huà)風(fēng)險(xiǎn)。模型需要在不完全觀察、世界變化與證據(jù)沖突中持續(xù)更新判斷;研究者也需要知道,錯(cuò)誤究竟發(fā)生在感知、記憶、因果模擬,還是不確定性表達(dá)上。
我們不僅要問(wèn)模型有沒(méi)有答錯(cuò),還要問(wèn):它的回答假定了一個(gè)怎樣的世界,以及這個(gè)世界從哪一步開(kāi)始偏離了現(xiàn)實(shí)。
—— 這或許才是未來(lái)幻覺(jué)研究真正應(yīng)該出發(fā)的地方。
![]()
關(guān)于作者:我們是主要來(lái)自 Stanford、CMU 等美國(guó)高校的獨(dú)立 AI 科研小隊(duì)DegenAI Labs,成立于 2025 年秋。這篇關(guān)于大模型幻覺(jué)統(tǒng)一定義的文章是我們團(tuán)隊(duì)第一篇公開(kāi)發(fā)布的論文,歡迎大家在公眾號(hào)或 twitter 等社媒上與我們學(xué)術(shù)交流;)
第一作者:Emmy Liu,CMU Language Technology Institute (LTI) 博士生,導(dǎo)師為 Graham Neubig;
通訊作者:Emmy Liu,Varun Gangal (Patronus AI 研究員 / CMU LTI PhD '22),Steven Y. Feng (Stanford AI 博士生 / Anthropic Research Fellow)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.