![]()
世界模型牌桌上,昆侖萬維已連出五張牌,一張比一張大。
作者丨幸麗娟
編輯丨齊鋮湧
世界模型的熱度,終究還是燒到了今年的 WAIC。
整場大會,論壇、展臺、發布會,世界模型幾乎成了“靈魂”一般的存在。
因為具身落地元年——AI 要邁向現實世界,世界模型必不可少。
不同于資本場中,創業公司頻頻用零產品、零營收撬動百億估值,大家在 WAIC 上追問的是更樸素也更直白的技術問題:世界模型如何真正理解物理世界?如何走向真實世界?
7月19日,昆侖萬維舉辦的“世界模型與多模態范式革命”專場論壇,用硬核的技術細節,回應了這些問題。
昆侖萬維董事長兼 CEO 方漢在論壇上進一步宣布:“2026年為世界模型元年。”
![]()
昆侖萬維董事長兼CEO方漢
而Matrix-Game 3.5,便是昆侖萬維在這個“元年”里,打出的一張王牌。
真實開放世界,Matrix-Game 3.5 實現效果
01
“物體恒存”這道基礎題,到底怎么解?
查看 Matrix-Game 3.5 發布的技術突破細節,會發現“物理恒存”是被單獨拎出來重點攻克的問題。
為什么?
因為這道物理世界最基礎的題,曾讓世界模型集體翻了車。
翻車這事,要從一個評測基準說起。
哈佛、MIT、IBM、谷歌聯合發布的一個評測基準,叫做 MemoBench,考的是“物體恒存”——東西離開視野再回來,還在不在?長什么樣?位置變沒變?
三歲孩童都能拿滿分, 十個主流世界模型集體不及格——滿分 1 分,最高分 0.58 分。
原因藏在 Matrix-Game 團隊曾對世界模型給出的定義框架中——理解當下狀態、預測下一個狀態、將預測結果渲染呈現。
而大多數模型只做到了第三層。“物體恒存”測試不及格,便是它們跳過了前兩層,直接“渲染”所付出的代價。
MemoBench 給的“評語”也很直白:現有模型即使能生成視覺上完全連貫的畫面,也幾乎無法在物體重新出現時,正確恢復它在消失期間本該經歷的狀態變化。
“物體恒存”問題,可以拆成三道更具體的題:
記不住:無法維持對物體身份的持續表征。
認不出:無法在物體重現時準確識別其身份。
變不對:無法正確推演并還原物體在消失期間發生的狀態變化。
Matrix-Game 3.5 一道一道,給解了出來。
▎“記不住”?Matrix-Game 3.5 :把“時間相冊”升級為“三維地圖”。
模型為什么會“記不住”?
這源自于 Transformer的結構性缺陷:注意力窗口越大,早期信息被稀釋得越嚴重。記住了新的,舊的就被擠出。
即便行業標桿谷歌 Genie 3,也只能保持約一分鐘的一致性,之后場景逐漸崩壞。
問題出在記憶方式上。模型記的是“第5幀左上角有個方塊”——時間索引。人類記的是“沙發在客廳角落”——空間索引。
時間索引隨序列線性增長,記憶容量爆炸。空間索引只隨場景復雜度增長,與時長無關。
Matrix-Game 3.5 實現業內首個幾何對齊的 Patch 級長期記憶,把記憶從時間索引切換為空間索引,將歷史觀察提升至三維Patch Memory。
![]()
記憶單元從“整幀”降到“局部圖像patch”——每個Patch獨立存儲、獨立檢索,通過幾何對齊按需調取和復用歷史內容。
模型記住的是“坐標(x,y,z)處有個物體”,不是“第5幀左上角”。
![]()
無論你離開多久、從哪個方向回來,地圖都在。
▎“認不出”?Matrix-Game 3.5 :從“認像素”升級到“認空間”。
認不出,兩個原因。
第一個:視角變了。同一個物體,正面看和側面看像素完全不同。
傳統模型用的是3D RoPE位置編碼,編的是時間 t 和二維坐標 (x,y)。模型知道“像素在畫面上的位置”,卻不知道“這個位置為什么在這里”——不知道相機轉了30度后像素該位移多少,也不知道這個像素對應真實世界的哪個點。
![]()
Matrix-Game 3.5 引入PRoPE,把相機投影矩陣直接編碼進時空位置。模型學的不再是“這個像素在(x,y)”,而是“這個像素來自哪個視角、對應空間哪個點”。
再加上Warped RoPE,記憶 Patch 的位置從“來自第5幀左上角”升級為“在當前視角下應出現在三維空間的哪個坐標”。
第二個:背景亂了。鏡頭在動、物體在移、光影在變,如果動態變化和靜態背景混在一起處理,背景表征被污染,模型連位置都搞不清,更別說認出物體。
Matrix-Game 3.5 的做法是動靜解耦記憶:Patch Memory負責記住穩定的靜態場景結構,主體參考 Token負責維持動態主體的身份和外觀一致性。動態物體在寫入記憶前被過濾掉,避免“一個移動的人”被誤認為“多個不同的人”,減少重影與時序混淆。
![]()
背景是坐標錨點,動態內容是前景事件。物體重現時,先定位空間位置,再對齊視角,讓模型認得準。
▎“變不對”?Matrix-Game 3.5 :把因果推理寫進訓練目標。
物體消失期間狀態在變。模型既要感知“變了”,還要推演出“變成什么樣”。
傳統做法兩步走:先理解狀態,再生成動作。分開訓練。
Matrix-Game 3.5 則打破傳統,提出了新的因果推理范式——狀態與動作聯合生成。
真實場景中,動作主體在運動過程中,畫面生成始終符合物理規律
狀態預測與動作生成聯合訓練,放在同一個損失函數下共同優化。模型學的不只是“下一幀長什么樣”,而是“如果我做這個動作,世界會怎樣改變”。
Matrix-Game 3.5 進一步通過實驗證明:聯合訓練后,狀態理解和動作預測能力雙雙顯著提升。
這種技術范式下,因果推理不是從數據里涌現的,它被直接寫進訓練目標,實現內生的因果推理能力。
三道題,三個對應解法,本質上是在做同一件事:讓模型從“復現像素”到“理解因果”,從“感知表象”到“洞悉物理規律”。
超 1 分鐘生成畫面切換不同視角,環境等細節始終連續、合理存在
02
從游戲走向真實世界,三關怎么過?
攻克“物體恒存”難題,只是起點。
但昆侖萬維在世界模型牌的野心不止于此,而是“推動世界模型跨越游戲邊界,邁向機器人控制與物理世界交互。”
從游戲沙盒到通用物理世界,中間隔著三大難關。每一關,都決定了世界模型能不能真正走到真實場景里。
▎第一關:數據——給視頻數據裝上“物理標尺”
游戲是可控的物理世界,真實世界是失控的。
互聯網視頻沒有深度標注,無法體現相機視角、運動軌跡。用這些數據訓練,模型學到的永遠是相對幾何關系,畫面在動,但不知道動了多少米、朝哪個方向。
真實數據稀缺,成為世界模型最大的瓶頸之一。
昆侖萬維采用的解法很重,但繞不過去:給視頻數據自動重建物理尺度。
他們搭建了三套自動化管線——
系統通過多Agent自動調研數千款游戲,篩選高價值數據源;
自動化離線標注管線估計每條視頻的相機位姿、米制深度、相機內參;
Scene-Quality 自動評估系統從幾何可重建性和生成訓練價值兩個維度評估數據質量。
![]()
三條自動化數據管線,產出 500 萬以上高質量視頻切片、1 萬以上有效訓練小時數,覆蓋 1200 多個游戲場景和真實物理場景。
別人喂模型的是“視頻”。昆侖喂模型的是帶物理尺度的世界觀測。
有了物理尺度,模型第一次能夠理解空間中的“距離”和“速度”,而不是僅僅識別像素的排列方式。
這是世界模型從“看像素世界“到“懂真實世界”的第一步。
▎第二關:交互——速度逼平實時,輸出直譯指令
數據問題解決了,下一個難題是:延遲。
機器人控制場景里,延遲不是性能指標,是安全紅線。卡一下,機械臂可能直接摔了碗,碰了人。不是“體驗不好”,是“會出事故”。
生成速度必須逼近實時。
Matrix-Game 3.5用三件事把推理推到極限。
先是 3 步采樣蒸餾。傳統擴散模型生成一幀要幾十步去噪,Matrix-Game 3.5 把它壓縮到3步,畫質不打折。
![]()
然后是 DiT 推理優化。做FFN INT8 量化來壓縮權重,用 KV Cache 緩存已生成的鍵值對,避免重復計算。
最后是 MG-LightVAE 剪枝。對視頻編碼器做約 75% 的結構化剪枝,輕量化編解碼。
三管齊下,5B 參數模型在單張 GPU上跑出了 720P 分辨率、約 20FPS 的實時生成。
復雜場景交互、視角切換流暢自然
交互關打通之后,世界模型從“觀察世界”進化到了“精準、實時干預世界”。
世界模型從虛擬世界走向真實場景,又邁進了一步。
▎第三關:算力——用架構設計替代堆參數
速度上去了,算力也要可持續。
即便是處理離散的 token 序列的大語言模型,也深陷算力黑洞。
世界模型處理的是連續視頻流,每一幀都要做完整的擴散生成,幾十步去噪,每步都要過Transformer。計算量跟大語言模型,完全不是一個量級。
最直接的路是堆算力:更大的集群,更多的GPU。但這不是可持續的路。
Matrix-Game3.5 做了一個根本性突破:除角色Reference Adapter外,核心功能幾乎不需要新增參數,即可實現交互世界建模,并可快速適配不同視頻基礎模型。
所有交互能力都靠架構設計本身實現,不靠堆參數硬撐。
這意味著什么?在引入交互、長時記憶和相機控制能力的同時,模型能夠最大程度保留基礎視頻模型原生的生成能力,無需犧牲開放內容生成質量。
這套交互框架可以快速嫁接到不同的視頻基礎模型上。不用重寫底層,不用為了加交互而犧牲畫質。開放內容生成、多風格切換、復雜場景建模——這些能力不會因為交互的加入而打折。
這種輕量化的交互框架設計,讓世界模型“真正可遷移、可落地”,從理想變成現實。
數據關,昆侖萬維給視頻裝上了“尺子”;交互關,把生成速度推過實時紅線,把輸出從“畫面”變成“指令”;算力關,用架構設計替代了參數堆疊。
昆侖萬維系統地打通了數據、交互、算力三個瓶頸,讓世界模型第一次具備了走進真實物理場景的完整條件。
這不是某個單點的工程優化和升級,是世界模型整個底層能力的系統化躍遷。
03
為什么是昆侖萬維?
世界模型的牌桌,英偉達、谷歌等全球巨頭搶先落座,Yann LeCun、李飛飛等學術大牛親自下場,創業公司扎堆涌入。
玩家眾多,座次未定。
而昆侖萬維已經連出五張牌——Matrix-Zero、1.0、2.0、3.0、3.5,一張比一張大。
憑什么?
▎第一,它起步最早,技術路線最清晰。
2022年,宣布“All in AGI 與 AIGC”;2024年, Matrix-Zero 開啟空間智能的體系化探索;2025年,Matrix-Game 1.0、2.0 接連發布;2026年,Matrix-Game 3.0、3.5 相繼炸場。
當同行還在摸索技術路徑,昆侖萬維已經用一次次技術迭代,驗證了一條清晰、完整的開發路線:雙向DiT預訓練→Self-Forcing/Causal Forcing蒸餾為因果模型→KVCache流式推理+記憶注入→25FPS的實時交互水平。
當行業還在爭論“世界模型到底是什么”,Matrix-Game 團隊已經給出了清晰的定義框架:理解當下狀態、預測下一個狀態、將預測結果渲染呈現。
當創業公司還在拿零產品、零營收講百億估值的故事,昆侖萬維已經發布了“一籮筐”的世界模型產品,而最新發布的 Matrix-Game 3.5,則率先完成“具備因果推理與行動能力的底層引擎”的轉身。
▎第二,它開源最堅決,拿下標準定義權。
昆侖萬維 Matrix-Game系列模型“一次發布一次開源”的節奏,足以證明它對開源的態度和決心。
2025年5月,Matrix-Game 作為工業界首個10B+空間智能大模型正式開源。
三個月后,SkyWork AI技術發布周,五天連發五款模型,其中 Matrix-Game 2.0 成為業內首個在通用場景上實現實時長序列交互式生成的開源方案。
![]()
論文地址:https://arxiv.org/abs/2508.13009
項目主頁:https://matrix-game-v2.github.io
更重要的是,它是國內唯一能夠對標谷歌 Genie 的開源方案。開源硬剛閉源,實力幾何,不言自明。
2026年3月,Matrix-Game 3.0,首次系統性地將記憶問題納入開源方案。
每一次進化,都在向 AI 社區敞開代碼、架構和思路。
這種堅持的價值,很快在社區中得到驗證。
學術圈先動了。DiT作者、紐約大學助理教授謝賽寧,這位與Yann LeCun共同擎起JEPA世界模型大旗的學術大牛,基于Matrix-Game 2.0的開源底座,發布了全球首個多人視頻世界模型Solaris。
一位站在全球世界模型舞臺的核心代表人物,啟用一家中國企業的開源模型做底層研發,足以證明 Matrix-Game 2.0 的技術底座已具備國際競爭力。
產業界緊隨其后。NVIDIA和浙大基于Matrix-Game 3.0 模型進行研發,聯合發布了世界模型相關工作 Light Interaction。
學術大牛、產業巨頭——兩個最嚴苛的驗證方,都用行動給 Matrix-Game 系列模型,投了票。
與此同時,Matrix-Game相關模型憑借扎實的技術底座和開源生態,逐漸成為同行玩家的共同參照系。NVIDIA 的 SANA-WM、Adobe 的 RELIC 等國際頭部大廠的世界模型工作,均將Matrix-Game 相關模型作為對比基準。
先開源者拿定義權,后來者只能兼容。當足夠多的團隊基于你的底座做研發、拿你的模型做對標,事實標準就開始形成。這不是誰指定的,是被用出來的。
開源換反饋,反饋換迭代,迭代換領先。這套邏輯,昆侖萬維又先一步,跑通了。
▎第三,它的生態最系統,壁壘越跑越厚。
2026年3月,昆侖萬維發布“4+3”AGI戰略。
![]()
四大模型底座:視頻模型、音樂音頻模型、世界模型、基座文本與多模態模型。三大平臺經濟體:AI短劇、AI音樂、AI游戲。
世界模型在這里不是孤立的技術模塊,是整個生態的底層引擎。
這套布局的精妙之處在于:游戲平臺跑出交互數據,視頻平臺產出訓練素材,音樂平臺豐富感知維度。數據從平臺流向模型,模型能力反哺平臺體驗,體驗吸引更多用戶,產生更多數據——四輪三軸,循環轉動,越轉越快。
視頻模型生產訓練數據,世界模型提升生成質量,游戲平臺驗證能力上限。每個模塊都在為其他模塊創造價值。
昆侖萬維用“模型-平臺-數據”三端閉環的系統,建立起一整個生態“護城河”。后來者,追的不僅僅是一個單一世界模型,而是一整個生態。
生態的壁壘越跑越厚,對手越來越“望塵莫及”。
▎第四,技術范式上限最高,因果推理能力“內生”。
最后要回歸到技術范式本身來談。
現在很多世界模型都說要學因果,但學的不是一種因果。
再次以谷歌 Genie 3 為例。
它的因果理解,是在海量視頻中隱式學習的統計關聯,其自回歸架構能逐幀生成連貫畫面,但受限于約一分鐘的記憶窗口,誤差會快速累積。一分鐘后,場景迅速崩壞。
它的目標是生成物理合理的視頻內容,要回答的問題是:“給定當前畫面和用戶操作,下一幀該長什么樣?”
而 Matrix-Game 3.5 的目標是輸出可執行的物理控制指令。它要回答的問題是:“給定當前狀態和預期結果,我該做什么動作?”成功標準是“指令執行后物理結果正確”。
因此,它將因果推理作為架構的第一性,采用狀態與動作聯合生成范式,狀態和動作在同一個損失函數下共同優化,模型被訓練去預測“動作→世界改變”的因果鏈條。
這種因果是“長”出來的,不是從數據里“看”出來的。
一個服務于“視覺模擬”,一個服務于“物理干預”。目標決定了技術范式,而技術范式決定了模型的能力上限。
04
結語:
國產世界模型,正在定義牌桌規則
Matrix-Game 3.5 不是終點。它是一個支點。
機器人訓練,不再需要真實世界的百萬次試錯。在世界引擎里,機器人摔一萬個碗,成本是Token“電費”。
自動駕駛仿真,不再需要封閉測試場的昂貴場景。在世界引擎里,暴雨、黑夜、突發橫穿,一鍵生成,完全不需要用安全事故做代價。
這些場景需要的不僅僅是“看起來像真的”,更要求“行為上真的”——杯子會碎、墻不能穿、左轉后視角真的變了、十分鐘后回來杯子還在。
傳統游戲引擎的代碼邏輯死了。Matrix-Game 3.5 用幾何理解、空間記憶和因果推理,讓世界第一次在模型里“活”了過來。
2026年7月19日,世界模型走向真實物理世界,由Matrix-Game 3.5開始。
率先出牌的昆侖萬維,正在定義世界模型整張牌桌的規則——國產世界模型,第一次跑出了“全球技術引領者”的姿態。
未經「AI科技評論」授權,嚴禁以任何方式在網頁、論壇、社區進行轉載!
公眾號轉載請先在「AI科技評論」后臺留言取得授權,轉載時需標注來源并插入本公眾號名片。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.