![]()
智東西
作者 王涵
編輯 漠影
要說過去一年AI領域討論最熱的方向,世界模型必須占有一席之地。
在過去18個月里,世界模型企業(yè)吸納了超過100億美元的投資,圖靈獎得主楊立昆(Yann LeCun)甚至預言三到五年內(nèi)它將取代大語言模型成為主流AI范式。
與此同時,世界模型的技術瓶頸正在暴露。
長期記憶能力薄弱、相機控制精度不足、實時交互能力有限,多數(shù)產(chǎn)品停留在“生成視頻”而非“交互世界”的階段。更重要的是,市面上的世界模型普遍缺乏對物理規(guī)則的理解,例如模型能生成一條狗跑動的畫面,卻不明白狗的四條腿為什么按這個順序落地。
就在這種混亂中,昆侖萬維旗下Skywork團隊在7月19日世界人工智能大會WAIC 2026期間,正式發(fā)布了世界模型Matrix-Game 3.5。
該模型能夠根據(jù)用戶動作和事件指令持續(xù)生成可交互的世界,并在長時序生成過程中保持場景結(jié)構(gòu)、空間布局、角色身份和動態(tài)內(nèi)容的一致性,為游戲、機器人、具身智能和 XR 等應用提供可持續(xù)交互的生成基礎。
一、三方面升級,實現(xiàn)端到端實時推理
3.5版本從模型吞吐優(yōu)化、DiT推理優(yōu)化和VAE解碼優(yōu)化三個層面構(gòu)建了完整的系統(tǒng)級加速方案,實現(xiàn)端到端實時推理。
首先,在模型吞吐優(yōu)化方面,Skywork團隊通過蒸餾將采樣步數(shù)壓縮至3-step Sampling,并設計分塊因果推理(Chunked Causal Inference),結(jié)合KV Cache、Patch Latent和預測Latent,在保持生成質(zhì)量的同時提高單次推理吞吐,顯著降低多步采樣帶來的整體延遲。
其次,在DiT推理優(yōu)化方面,Skywork團隊還針對推理熱點進行了系統(tǒng)優(yōu)化,包括FFN INT8量化、Memory Retrieval Optimization以及Torch.compile等推理加速技術,在幾乎不影響模型效果的情況下進一步降低DiT推理耗時。
最后,在VAE解碼優(yōu)化方面,Skywork團隊使用3.0版本中的MG-LightVAE,對Wan2.2 VAE Decoder進行約75%結(jié)構(gòu)化剪枝。在保持與原始Wan VAE接近重建質(zhì)量的同時,該架構(gòu)可以大幅降低VAE解碼延遲,使VAE不再成為系統(tǒng)整體性能瓶頸。
通過上述系統(tǒng)級優(yōu)化,Matrix-Game 3.5實現(xiàn)了減少采樣步數(shù)+DiT推理優(yōu)化+VAE加速的完整推理加速方案,最終在單張GPU上實現(xiàn)720P分辨率、約20FPS的實時流式視頻生成。
二、四大技術優(yōu)勢,解決長時一致性問題
據(jù)Skywork團隊披露的信息,Matrix-Game 3.5還有四個核心差異化優(yōu)勢。
1、長期記憶機制
對于長期記憶,Matrix-Game早期版本的做法是原樣存儲歷史幀,推理時檢索相關幀拼接到上下文中——占用大量上下文窗口,跨幀拼接時容易出現(xiàn)畫面沖突。
3.5版本將歷史幀切分為三維坐標系下的空間塊,檢索時按空間位置匹配,再重組成當前視角的記憶圖。畫面一致性更高,相機軌跡更穩(wěn)定,記憶可以隨時更新、替換、刪除。
Matrix-Game 3.5的Patch Memory是業(yè)內(nèi)首個幾何對齊的Patch級長期記憶機制。
行業(yè)評測顯示,主流世界模型的“物體重現(xiàn)得分”沒有一個超過0.6,即相機離開再回來,場景里的物體可能就消失了。
Patch Memory可以將局部圖像patch作為基本記憶單元,在空間上按需檢索、對齊和復用歷史內(nèi)容,讓模型在相機重訪場景時能準確找回此前觀察過的空間內(nèi)容。
2、動靜解耦記憶機制
此外,該模型采用動靜解耦記憶機制,讓Patch Memory負責記住靜態(tài)場景結(jié)構(gòu),主體參考Token負責維持動態(tài)主體的身份一致性。動態(tài)物體在寫入記憶前會被過濾掉,避免移動物體被誤認為多個靜態(tài)物體。
3、相機控制精度
傳統(tǒng)視頻模型使用的3D RoPE只編碼時間和二維空間位置,難以表達不同視角之間的真實幾何關系。Skywork團隊發(fā)現(xiàn),此前把鼠標信號通過Self-Attention注入、鍵盤信號通過Cross-Attention注入的做法,雖然直觀,但每次加入?yún)?shù)都會破壞模型對原始視頻分布的認知,需要大量額外訓練來修復基礎能力
在架構(gòu)層面,3.5版本做了一個關鍵調(diào)整:不再將動作控制信號作為額外參數(shù)注入模型,而是采用相機位姿相對編碼PRoPE機制,通過相機投影矩陣讓模型直接感知相機相對位姿。
Matrix-Game 3.5將PRoPE加Warped RoPE進行組合,其中Warped RoPE可以重新定義記憶Patch在當前視角下應該出現(xiàn)的位置——位置編碼從簡單的時空索引升級為具備幾何語義的世界表示。
4、輕量化框架
輕量化的交互框架是Matrix-Game 3.5另一個值得注意的特點。除角色Reference Adapter外,該模型的核心功能幾乎不需要新增模型參數(shù)即可實現(xiàn)交互世界建模,并可快速適配不同的視頻基礎模型。
三、讓行業(yè)頭疼的數(shù)據(jù),成了護城河
除了以上技術優(yōu)勢,Matrix-Game 3.5還有一個很值得細說的“技術護城河”,就是其在數(shù)據(jù)基礎建設上的成果。
如果說大語言模型的瓶頸是算力,那么世界模型的瓶頸首先是數(shù)據(jù)。
互聯(lián)網(wǎng)視頻的數(shù)據(jù)分布與世界模型需要的物理世界數(shù)據(jù)存在本質(zhì)差異:互聯(lián)網(wǎng)內(nèi)容很多是娛樂性的,甚至包含反物理規(guī)律的內(nèi)容,比如人也可以飛起來。
而世界模型需要的是接觸豐富、包含推拉擰拽等動作、涵蓋柔性物體、摩擦力、流體等多樣物理交互的真實數(shù)據(jù)。
更棘手的是數(shù)據(jù)規(guī)模。國際領先大語言模型的預訓練數(shù)據(jù)已達100萬億Token,等效約100億小時的說話量。
物理世界數(shù)據(jù)的信息密度遠低于文本,要實現(xiàn)更高階的物理常識判斷,可能需要“億小時”量級的真實世界數(shù)據(jù)。
對于數(shù)據(jù)采集,Skywork團隊給出的解決方案是三條自動化數(shù)據(jù)生產(chǎn)管線:
1、第一條基于Unreal Engine 5的自主探索管線,在UE5中搭建常見游戲場景,部署RL Agent進行自由探索,在探索過程中實現(xiàn)毫秒級同步采集,完整記錄視覺畫面、動作狀態(tài)及相關語義信息。
2、第二條是跨游戲自動化控制與探索管線,覆蓋《GTA V》《荒野大鏢客2》《賽博朋克2077》等主流3A游戲,實現(xiàn)跨游戲的自動控制、自動探索、自動錄制與自動標注。
3、第三條是開放平臺視頻自動挖掘管線,從開放平臺自動獲取游戲視頻,通過VLM評分篩選高質(zhì)量片段,自動完成鏡頭切分、過濾與結(jié)構(gòu)化標注。
此外,Skywork團隊構(gòu)建了自動化的離線標注管線,為每條視頻估計相機位姿(Camera Pose)、米制深度(Metric Depth)以及相機內(nèi)參。
Skywork團隊還構(gòu)建了基于多模態(tài)大模型的視頻Prompt自動標注系統(tǒng),該系統(tǒng)以固定長度的視頻窗口作為標注單元,通過抽取關鍵幀理解場景內(nèi)容,并生成覆蓋整個窗口的統(tǒng)一描述,在保證時序一致性的同時顯著降低了標注成本。
為了評估數(shù)據(jù)質(zhì)量,Skywork團隊搭建了Scene-Quality自動評估系統(tǒng),可以對每個場景進行多維質(zhì)量分析,并輸出統(tǒng)一的質(zhì)量評分。
四、不到兩年四次迭代,被英偉達和Adobe作為基準
Matrix-Game系列從1.0到3.5,進化路徑非常清晰。
2025年3月,昆侖萬維發(fā)布的Matrix-Game 1.0版本是早期可交互世界模型的一次概念驗證;
2025年8月,該系列模型發(fā)布2.0版本,實現(xiàn)了單卡B100、720P分辨率下25FPS的實時交互,成為業(yè)界首個開源方案;
Matrix-Game 3.0版本在2026年3月發(fā)布,5B參數(shù)蒸餾模型實現(xiàn)了720P下40FPS的實時生成,補齊了世界模型公認的三大短板——記憶、長時程、實時性。
此次正式發(fā)布的3.5版本的最大變化是從游戲場景向真實場景全面擴展,它支持多風格動態(tài)切換與指令控制,引入了NPC交互能力,并全新升級了長時記憶能力。
更難得的是,Matrix-Game始終堅持開源策略。
此前,DiT作者、紐約大學助理教授謝賽寧團隊基于Matrix-Game 2.0的開源底座,發(fā)布了全球首個多人視頻世界模型Solaris,也從學術圈的實際使用上印證了這套開源方案的基礎模型價值。
英偉達和浙大聯(lián)合發(fā)布的工作Light Interaction同樣是基于Matrix-Game 3.0模型進行研發(fā)。另外,英偉達的SANA-WM和Adobe的RELIC等國際頭部大廠世界模型工作,均將Matrix-Game相關模型作為對比基準。
結(jié)語:昆侖萬維的目標,是更廣闊的物理世界
昆侖萬維董事長兼CEO方漢給出判斷:2026年是“世界模型元年”。這個判斷意味著,在今年,世界模型的道路或許會逐漸收束,數(shù)據(jù)、訓練的難題也會被逐一攻破。
Matrix-Game 3.5的定位正是回應這個判斷。它不是只做渲染,也不是只做規(guī)劃,而是把狀態(tài)理解和動作生成放在同一個框架里訓練,讓模型同時學會“理解世界”和“行動于世界”。
Matrix-Game 3.5同時也是昆侖萬維“4+3”AGI戰(zhàn)略的核心組成部分。在這一戰(zhàn)略框架下,視頻模型SkyReels、音樂模型Mureka、世界模型Matrix-Game、基座文本與多模態(tài)模型構(gòu)成了四大技術底座,AI短劇、AI音樂、AI游戲三大平臺經(jīng)濟體則承載著商業(yè)化落地。
在WAIC 2026的專場論壇上,昆侖萬維集中完成了四大核心模型的全球首發(fā)——世界模型只是其中的一塊拼圖,但也是最關鍵的那塊。
Matrix-Game 3.5正式亮相后,行業(yè)關注的將不只是它的技術參數(shù),還有它能否真正跨越游戲與物理世界之間的那道門檻。
昆侖萬維的目標,其實指向的是更廣闊的物理世界。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.