![]()
作者|樊雅婷
微信| FFF111f__
2026 年上半年,“世界模型”已經從論文里的技術詞,變成了 AI 公司、機器人公司、自動駕駛公司和 VC 討論里繞不開的關鍵詞。視頻生成模型說自己能模擬物理世界,具身智能團隊說自己要用世界模型訓練機器人,自動駕駛公司說生成式仿真可以替代一部分真實路測。
但問題也隨之變得尖銳:一個模型會生成漂亮視頻,就等于它理解世界了嗎?它能不能遵守物理規律?能不能保持 3D 幾何一致?能不能服務自動駕駛和機器人決策?能不能從“看起來像真的”,走到“用起來真的有用”?
所以,比起只看 demo,更應該看 benchmark。下面這五個世界模型benchmark包含通用視頻世界模型、統一世界生成、自動駕駛、具身智能、物理推理。它們不是所有 benchmark 的全集,但基本覆蓋了當下世界模型最關鍵的五條主線。
1
1. WorldModelBench
一句話介紹: WorldModelBench 把視頻生成模型當作世界模型來考,不只問畫面好不好看,還問指令、常識和物理是否經得起檢查。
![]()
概述
WorldModelBench 解決的是通用視頻模型評測里最核心的缺口:過去很多 benchmark 偏向視覺質量、文本對齊或人類偏好,但“世界模型”真正要回答的是,模型是否理解動作、場景因果和基礎物理。它覆蓋機器人、自動駕駛、工業、人類活動、游戲、動畫、自然等 7 個應用域,細分到 56 個子域,使用 350 個圖文提示,并用指令跟隨、常識、物理遵守三大維度評測。物理部分重點看牛頓第一定律、形變、流體、穿透、重力等常見“世界建模幻覺”。論文還眾包了 6.7 萬個人類標注,并訓練了一個 human-aligned judge 來自動評測。在結果上,Kling 等閉源模型整體靠前,Mochi、OpenSoraPlan 等開源模型在部分維度接近閉源模型,但論文的核心結論不是“誰已經解決了世界模型”,而是頭部模型仍然離可靠世界模擬器很遠。
團隊
發布團隊來自 UC Berkeley、UC San Diego、NVIDIA 和 MIT ,Ion Stoica 是 UC Berkeley 計算機教授,也是 Databricks、Anyscale 等公司的共同創始人;Joseph E. Gonzalez 是 Berkeley EECS 教授、Sky Computing Lab / RISE Lab 共同負責人,并屬于 BAIR 生態。這使 WorldModelBench 不只是一個視頻評分集,而是系統、視覺、機器人和高效 AI 團隊共同推動的世界模型評測。
為什么值得關注
它是最適合作為“通用視頻世界模型入門基準”的 benchmark。因為它沒有只停留在審美和清晰度,而是把世界模型拆成應用域、物理規律和細粒度錯誤類型,特別適合判斷一個視頻模型到底是在“生成像世界的圖像”,還是在“模擬一個能自洽演化的世界”。
入口
項目:https://worldmodelbench-team.github.io/
論文:https://arxiv.org/abs/2502.20694
代碼與評測:https://github.com/WorldModelBench-Team/WorldModelBench
測試數據:https://huggingface.co/WorldModelBench-Team
1
2. WorldScore
一句話介紹: WorldScore 把 3D、4D、圖生視頻、文生視頻模型放到同一個“下一場景生成”框架里評測,重點看模型能不能按相機軌跡持續生成世界。
![]()
概述: WorldScore 解決的是“不同世界生成路線無法公平比較”的問題。3D 模型、4D 模型和視頻模型輸出形態不同,過去很難在同一張表里比較。WorldScore 將世界生成拆成一系列基于明確相機軌跡的 next-scene generation 任務,用 3000 個樣例覆蓋靜態/動態、室內/室外、寫實/風格化等場景,并從可控性、質量、動態三方面打分。可控性看相機控制、物體控制和內容對齊,質量看 3D 一致性、光度一致性、風格一致性和主觀質量,動態看運動準確性、幅度和流暢度。官方結果顯示,Voyager、WonderWorld、LucidDreamer 等 3D/場景生成模型在靜態世界生成上很強,CogVideoX-I2V 等視頻模型在動態分數上表現突出;同時,T2V 模型通常更容易被文本控制,I2V 模型往往畫質更穩。
團隊
WorldScore 是 Stanford University 團隊發布,論文作者為 Haoyi Duan、Hong-Xing Yu、Sirui Chen、Li Fei-Fei、Jiajun Wu。Li Fei-Fei 是 Stanford 計算機系 Sequoia Professor、Stanford HAI 創始聯合主任,曾任 Stanford AI Lab 主任和 Google Cloud AI/ML 首席科學家,創辦World Labs,也是 ImageNet 的關鍵推動者;Jiajun Wu 是 Stanford 計算機系助理教授,同時兼任心理學方向,研究計算機視覺、機器人和計算認知科學,所在方向天然貼近“世界如何被表示、推理和生成”。因此,WorldScore 更像是 Stanford 視覺學習、3D/物理場景理解和生成模型研究脈絡下的一套世界生成度量。
為什么值得關注:
如果說 WorldModelBench 更像“視頻模型是不是世界模型”的體檢,WorldScore 則更像“世界生成路線大橫評”。它把 3D、4D、視頻三條技術路線放進統一協議,對創業公司和研究團隊判斷技術路線很有價值:到底該押視頻生成、3D 生成,還是更混合的 4D 世界生成。
入口
項目頁:https://haoyi-duan.github.io/WorldScore/
論文:https://arxiv.org/abs/2504.00983
代碼:https://github.com/haoyi-duan/WorldScore
數據集:https://huggingface.co/datasets/haoyi-duan/WorldScore
1
3. WorldLens
一句話介紹: WorldLens 專門評估自動駕駛世界模型,核心問題是:生成的駕駛世界不只要像,還要幾何穩定、物理合理、行為安全、對下游任務有用。
![]()
概述
WorldLens 解決的是自動駕駛場景里“視覺逼真但功能失真”的問題。駕駛世界模型很容易生成看起來合理的 4D 場景,但一旦切到重建、閉環控制、下游檢測分割,就會暴露幾何漂移、運動不穩定、碰撞、偏離道路等問題。WorldLens 用五個互補方向評測:Generation、Reconstruction、Action-Following、Downstream Task、Human Preference,并進一步構建 WorldLens-26K 人類偏好數據和 WorldLens-Agent 視覺語言評審器。項目結論非常現實:沒有單一模型能在所有維度統治榜單,紋理真實的模型可能物理和幾何不穩,幾何穩定的模型又可能行為細節不足。論文實驗中,DiST-4D 在新視角質量和部分下游任務上表現強,OpenDWM 等模型在幾何穩定性上有優勢,DriveDreamer-2 也在任務相關指標中進入強勢梯隊。
團隊
WorldLens 由 WorldBench Team 發布,NUS、University of Macau、USTC、Zhejiang University、NTU、Horizon Robotics、HUST、TUM、Fudan University、Shanghai AI Lab、A*STAR、CNRS 等。核心作者包括 Ao Liang、Lingdong Kong、Tianyi Yan、Hongsi Liu、Ziqi Huang等。Lingdong Kong 是 NUS 計算機系博士生、項目牽頭人,長期維護自動駕駛和 3D/4D 世界建模相關項目;Ziwei Liu 是 NTU MMLab 的 Associate Professor / Provost's Chair in AI,研究覆蓋計算機視覺、機器學習和計算機圖形;Liang Pan 是 Shanghai AI Lab 研究科學家,長期做 3D 視覺、world models 和 embodied AI;Wei Tsang Ooi 是 NUS 多媒體系統方向教授。這個組合讓 WorldLens 同時站在自動駕駛、4D 場景、3D 視覺和人類偏好評測的交叉點上。
為什么值得關注
自動駕駛是世界模型最容易落地、也最不能只看 demo 的領域。WorldLens 的價值在于把“生成世界”拉回到了安全、閉環和下游任務上:一個模型生成的視頻再漂亮,如果會讓感知模型退化,或者讓 planner 在模擬世界里撞車,它就不能算可靠的駕駛世界模型。
入口
項目頁:https://worldbench.github.io/worldlens
論文:https://arxiv.org/abs/2512.10958
代碼:https://github.com/worldbench/WorldLens
Leaderboard:https://huggingface.co/spaces/worldbench/worldlens
1
4. WorldArena 2.0
一句話介紹: WorldArena 評估具身世界模型是否真的能服務機器人任務,而不僅僅是生成一段看起來不錯的操作視頻。
![]()
概述
WorldArena 解決的是具身智能里“感知質量和功能價值脫節”的問題。很多 embodied world model 可以生成高質量視頻,但機器人真正關心的是:它能不能合成有用訓練數據?能不能作為 policy evaluator 評估策略?能不能幫助 agent 做 action planning?WorldArena 先用 16 個指標評測視頻感知質量,覆蓋視覺質量、運動質量、內容一致性、物理遵守、3D 準確性、可控性 6 個子維度,再評估三類具身功能:Data Engine、Policy Evaluator、Action Planner,并提出 EWMScore 做統一度量。
WorldArena 2.0 在這個基礎上繼續擴展:第一,模態從 vision-only 擴展到 visuo-tactile,讓模型必須處理接觸、力、滑動和材料交互;第二,功能從離線評估擴展到 online RL,把世界模型當作可交互環境來訓練和改進策略;第三,平臺從 simulator-only 擴展到 RoboTwin 2.0、LIBERO 和 AgileX split-type ALOHA 真實機器人。它的結論也更貼近產業問題:模擬環境里的好成績不等于真實部署能力,sim-to-real gap 仍然是具身世界模型必須跨過的硬門檻。
團隊
多機構聯合聯合發布:Tsinghua University、Shanghai Jiao Tong University、The University of Hong Kong、Princeton University、Chinese Academy of Sciences、University of Science and Technology of China、Peking University、National University of Singapore。作者包括 Yu Shang、Zhuohang Li、Yiding Ma、Weikang Su、Xin Jin等。Yong Li 是清華 FIB Lab 重要負責人,長期做 AI、數據挖掘和城市智能;Jun Zhu 是清華 Bosch AI Professor、IEEE/AAAI Fellow,研究機器學習、深度生成模型、強化學習和對抗魯棒性;Wenwu Zhu 是清華計算機系教授,曾在 Microsoft Research Asia、Intel Research China 等產業研究機構擔任重要角色;Tat-Seng Chua 是 NUS School of Computing 的 KITHCT Chair Professor,也曾任 NUS Computing 創院院長。這個陣容讓 WorldArena 更像具身世界模型領域的“學術-機器人-多媒體-系統”聯合評測。
為什么值得關注
它把世界模型從“會不會生成未來幀”推進到“能不能讓機器人變強”。這對具身智能非常關鍵,因為真正的機器人世界模型不只是模擬畫面,而是要成為數據引擎、環境代理和規劃模塊。WorldArena 是目前少數把 perception 和 functional utility 放在同一個框架里嚴肅評估的 benchmark。
入口
項目頁:https://world-arena.ai/
論文:https://arxiv.org/abs/2602.08971
代碼:https://github.com/tsinghua-fib-lab/WorldArena
Leaderboard:https://huggingface.co/spaces/WorldArena/WorldArena
1
5. Physics-IQ / Physics-IQ Verified
一句話介紹: Physics-IQ 用真實物理實驗視頻考視頻生成模型,直接追問一個根本問題:模型是在理解物理,還是只是在預測像素?
![]()
概述
Physics-IQ 解決的是“視覺真實不等于物理理解”的問題。它要求模型根據真實世界物理視頻的前半段預測后續演化,覆蓋固體力學、流體動力學、光學、熱力學、磁學五類物理現象。評測不看視頻是否“看起來高級”,而是看模型預測的物理變化在空間、時間和運動區域上是否接近真實結果。論文評估了 Sora、Runway、Pika、Lumiere、Stable Video Diffusion、VideoPoet 等模型,結論相當直接:當前視頻生成模型的物理理解仍然有限,并且與視覺真實感并不強相關;多幀條件通常比單幀條件更有幫助,流體現象相對更容易,固體力學更難。2026 年 6 月又出現了 Physics-IQ Verified,對原始樣本和 prompt 做了系統審計和修訂;如果是實際跑評測,優先關注 Verified 版本會更穩。
團隊
Physics-IQ 由 Saman Motamed、Laura Culp、Kevin Swersky、Priyank Jaini、Robert Geirhos 發布,論文首頁標注 Saman Motamed 來自 INSAIT / Sofia University,相關工作在 Google DeepMind 期間完成,其余作者來自 Google DeepMind。INSAIT 官方報道也明確稱該 benchmark 由 INSAIT 與 Google DeepMind 聯合開發,并在 ICCV 2025 引發關注。Saman Motamed 是 INSAIT 的 ELLIS PhD student,研究計算機視覺、生成模型和 intuitive physics;Robert Geirhos 是 Google DeepMind Staff Research Scientist,長期做視覺魯棒性、可解釋性和人機視覺比較,代表工作包括深度網絡 texture bias / shortcut learning 方向;Priyank Jaini 和 Kevin Swersky 也都來自 Google DeepMind 的生成模型與機器學習研究線。這個團隊的優勢是把真實物理實驗、視覺心理學式問題意識和前沿視頻模型研究放到了一起。
為什么值得關注
物理是世界模型敘事里最難繞開的底層能力。一個模型可以生成電影感水花、爆炸和碰撞,但如果它無法預測真實物體會如何繼續運動,它就很難成為可靠的世界模型。Physics-IQ 的價值在于它足夠直接:少講“像不像”,多問“對不對”。
入口
項目頁:https://physics-iq.github.io/
論文:https://arxiv.org/abs/2501.09038
代碼:https://github.com/google-deepmind/physics-iq-benchmark
Physics-IQ Verified:https://arxiv.org/abs/2606.18943
世界模型現在處在一個概念快速升溫、技術路線分叉、評測體系追著產業敘事補課的混亂期。也正因為混亂,benchmark 才值得看:它們是這場定義爭奪里,少數能把口號落到測試題上的東西。
Benchmark 可以給一個還很松散的概念畫邊界。WorldModelBench 考察視頻模型有沒有常識和物理約束;WorldScore 衡量不同世界生成路線能不能統一比較;WorldLens 可以用來評估駕駛世界是否真的對安全和下游任務有用;WorldArena 看的是具身世界模型是否真的能服務機器人;Physics-IQ 則把邊界壓到最底層,問模型到底是在理解物理,還是只是在補像素。
世界模型發展到今天,評測的重要性正在日益凸顯,語言模型已經更早證明了這件事,借鑒語言模型的經驗,早日確定核心評測方向,也將成為未來競爭的關鍵。
![]()
點個“愛心”,再走 吧
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.