編輯|澤南
刷短視頻時,我們吐槽 AI 視頻的 bug;聽 AI 寫的歌,總覺得缺了「人味」;仔細看機器人的 demo,會發現它們其實還不太會做家務……人工智能這些看似不相關的短板,本質上都指向同一個問題:它們還沒有真正理解真實世界的運行規律。
這個困擾全行業的難題,在 WAIC 得到了一份體系化的回答。7 月 19 日,一場專場論壇上,昆侖萬維董事長兼 CEO 方漢提出一個核心論斷:2026 年是世界模型元年。
支撐這句論斷的,是一套橫跨虛擬與物理世界的全模態模型矩陣。
![]()
當 AI 擁有了對真實世界的統一認知能力,數字內容創作與物理世界交互的邊界,都將被徹底重構。
今年的 WAIC,世界模型成為勝負手
作為 AI 產業的年度風向標,世界人工智能大會(WAIC)的熱鬧肉眼可見:1100 余家參展企業、超 300 款全球首發產品,幾乎所有主流科技公司都把年度壓箱底的成果搬來了現場。熱鬧的展區背后,整個行業的路線分野已經非常清晰。
算力賽道在卷集群規模:華為拿出 8192 張卡組成的昇騰超節點,中科曙光、沐曦等廠商扎堆上新超算產品,比的是萬卡級集群的工程能力與算力密度;機器人賽道在卷硬件形態:智元推重載人形,啟元做可變形機器人,多數玩家仍在本體性能、特定場景專用性上貼身肉搏;大模型賽道在卷參數效率:月之暗面的 2.8 萬億開源模型 Kimi K3,讓國內模型與世界第一的差距已經從 3-6 個月縮短到了幾周。
作為 AI 領域最前沿的方向,世界模型也正在從學術概念走向產業落地。但多數玩家仍停留在垂直場景的單點嘗試:有人做 AI 影視,有人做植物仿真,卻很少有人回答一個最根本的問題:能不能用一套統一的世界認知能力,同時解決數字內容、具身智能等多個領域的底層難題?
其實,有人早在四年前就開始布局這條路線。
今天昆侖萬維的集中發布是其 AI 戰略四年演進的關鍵里程碑:從 2022 年確立 All in AGI 與 AIGC 戰略,率先押注全模態內容生成賽道,到 2026 年方漢正式提出「世界模型元年」的行業判斷,昆侖萬維完成了從多模態內容生成到可交互世界模型的戰略躍遷,不再滿足于讓 AI 生成孤立的文本、圖像、音頻內容,希望通過讓 AI 真正理解世界的運行規則,構建打通數字內容與物理實體的統一認知底座。
在所有參展企業中,昆侖萬維是唯一一家在同一場論壇中,集中發布橫跨世界模型基座、數字內容創作、具身智能三大領域的全模態模型矩陣的企業。
這套全模態布局有著清晰的邏輯:
- 在物理世界層面,由Riemann-1.0 具身動作模型將時空理解能力延伸到機器人控制,構建了跨本體泛化的機器人通用大腦;
- 在基座層,Matrix-Game 3.5 實時交互世界模型打造底層認知能力,嘗試解決世界模型的長時序一致性與實時交互難題;
- 在數字內容層,Mureka V9.5 與 O3把認知與推理能力落地到音樂創作領域,推動了 AI 音樂從生成工具向創作范式升維。
從虛擬到物理,從基座到場景,一套完整的世界模型落地體系已然成型。
Riemann-1.0,做機器人的 「通用大腦」
這一路線的價值,先在最復雜的物理世界得到了驗證。
很長一段時間里,具身智能都逃不出僅限 Demo 的尷尬:換個桌面、換件衣服,它就不會操作了,長流程任務更是頻頻出錯。問題的根源在于 AI 不懂物理規則,也沒有泛化能力,換個場景就得重新學。
WAIC 上,昆侖萬維旗下獨立公司黎曼機器人帶來的 Riemann-1.0 正在打破這個困局。
現場演示中,它能穩定完成有序積木堆疊:
![]()
能處理物件繁雜的廚房整理:
![]()
Riemann-1.0 將世界模型的能力邊界從數字世界延伸到了物理世界,致力于打造一款可跨本體、跨任務、跨場景的 World Action Model(世界動作模型),成為所有機器人的通用大腦。
在 Riemann-1.0 之前,機器人智能的技術路線已經歷了兩代演進:第一代是專用策略模型,針對特定任務、單一機器人本體端到端訓練,泛化能力差、訓練效率低;第二代是 VLA(視覺 - 語言 - 動作)模型,引入大語言模型的語義理解能力,把「看懂任務」和動作生成連接起來,但仍缺乏對物理時空動態的深層理解。
Riemann-1.0 所代表的第三代路線 WAM(世界動作模型)如今更進一步,將機器人動作生成、環境狀態演化與未來多視角視覺預測納入同一個因果生成框架,讓模型同時掌握執行動作的策略與預判視覺后果的能力,實現世界理解、未來預測與閉環控制的一體化學習。
具體到架構設計上,Riemann-1.0 構建了統一的動作 - 視頻聯合建模體系:
![]()
模型以 Wan2.2 latent-space DiT 為主干,在繼承其高質量視頻潛空間建模能力的基礎上,進一步引入動作 token、狀態 token、本體專屬映射模塊以及動作預測頭,實現了對不同機器人形態、傳感器配置和連續動作空間的統一適配。
這種設計的核心價值在于讓機器人具備了「預判動作后果 - 實時修正決策」的主動認知能力。
為此在數據基建上,Riemann-1.0 構建了一套覆蓋三類來源的多源數據聚合矩陣,包括人類第一視角視頻、UMI / 外骨骼手套數據以及機器人軌跡數據,總規模達 23.2 萬小時,解決了數據規模、泛化性與監督精度三大問題。
![]()
為了將異質性極強的多源數據轉化為可統一訓練的高質量樣本,團隊搭建了全自動的六階數據清洗引擎,首次驗證了「海量人類視頻預訓練 + 少量機器人數據微調」的技術路徑可行性,用低成本、規模化的人類交互數據嘗試解決泛化問題。
在訓練上,Riemann-1.0 采用了三階段漸進式策略: LAM 偽動作預訓練 + 真實動作監督訓練 + 機器人策略增強訓練。
無論是仿真基準還是真機實測,Riemann-1.0 都展現出了顯著的領先優勢,尤其在長時序操作、視覺泛化與跨場景遷移等體現通用能力的維度上優勢突出。其在 LIBERO 基準上成功率達到 99.0%,處于行業第一梯隊;RoboCasa-365 基準成功率達 62.6%,領先此前 SOTA 模型 8.4%;RoboTwin2.0 基準:成功率達 94.3%,展現了穩定的雙端聯合建模能力。
更具說服力的是人類數據有效性的消融實驗:在相同機器人示教數據量的前提下,加入人類第一視角數據預訓練后,模型在長程已見場景的成功率提升了 28.15%,長程未見場景提升了 16.97%;對比業界基線 EgoVLA,Riemann-1.0 在長程任務上領先幅度超過 25%。
這證明新模型的性能提升源于通用世界理解能力的增強,人類交互經驗確實能夠有效轉化為機器人的操作泛化能力。
機器人能在物理世界做到穩定泛化,本質上依賴的是對空間、幾何、因果的底層認知能力,這套能力的源頭來自昆侖萬維打磨多年的數字世界基座。
Matrix-Game 3.5,破解世界模型長時序一致性難題
從視頻生成到世界模型,近期整個行業一直卡在同一個瓶頸:AI 只能生成短時間連貫的畫面,鏡頭一轉、場景一換,結構就亂了。想要做實時交互的開放世界,更是會出現空間錯位、物體穿模、記憶丟失等一系列問題。
WAIC 現場展示的 Matrix-Game 3.5,正在把可交互的開放世界從概念變成可落地的基礎設施。
它可以生成結構自洽、可自由探索的復雜物理場景:
![]()
也能生成空間精準、支持實時交互的 FPS 游戲地圖:
![]()
作為全模態模型矩陣的基座層核心,Matrix-Game 3.5 是整套技術體系的「世界認知底座」。它是一款能夠持續交互、具備長期空間記憶的實時流式世界模型。其核心目標是推動 AI 進化成為能生成可持續探索交互,且時空自洽的開放世界。
這也是行業公認的下一代 AI 演進方向。
![]()
近幾年來,世界模型的技術路線經歷了清晰的代際變革:2023-2024 年以 Sora、Veo 為代表的視頻模型爆發,到 DeepMind Genie 系列逐步實現了從 2D 到 3D、從離線到實時交互的突破,全行業正在進入「可交互世界」的新階段。
在這個過程中,Matrix-Game 系列始終沿著開源可落地的路線同步推進:從業內首個實現單卡實時交互的 Matrix-Game 2.0,到首個系統性解決記憶問題的 3.0 版。本次升級的 3.5 版正在將世界模型轉化為可被產業低成本復用的通用基礎設施。
Matrix-Game 3.5 從記憶機制、幾何編碼到動靜關系完成了底層架構升級,系統解決了長期困擾世界模型的長時序一致性差、相機控制不穩、動態物體易失真三大核心痛點。
首先是長時序生成的場景一致性。此前行業主流的 Frame 級記憶方案要么以整幀特征為記憶單元,跨視角對齊精度不足;要么依賴全局三維重建,靈活性差且容易累積全局誤差。
Matrix-Game 3.5 帶來的 Patch Memory 技術兼顧精度與靈活性,它將歷史圖像切分為多個局部 Patch,結合米制深度與相機位姿,把每個 Patch 反投影到三維世界坐標系中存儲。當生成新視角畫面時,再根據當前相機視錐,檢索可見區域的歷史 Patch 并重新投影到目標視角,形成空間記憶畫布注入模型。
這套機制帶來了更精準的空間記憶、更高的自由度、靈活的場景編輯能力,以及穩定的長時間生成。
另一方面,傳統視頻模型依賴的 3D RoPE 僅能編碼時間與二維空間位置,無法表達不同視角間的真實幾何關系,這會導致 AI 生成視頻常出現相機運動混亂、視角邏輯不自洽的問題。
Matrix-Game 3.5 創新性地提出了 PRoPE(相機位姿相對編碼)方案,其直接將相機投影矩陣融入 Transformer 的位置編碼體系,讓視角幾何關系成為注意力機制的天然組成部分。模型在建立跨幀關聯時,不僅能理解時序與空間位置,更能感知不同視角間的旋轉、平移與投影關系,從而實現更穩定、更精確的相機運動控制。
這套方案無需增加模型參數,最大程度保留了基礎視頻模型的原生生成能力,同時可快速遷移適配不同的視頻基座模型。配合 Warped RoPE,記憶 Patch 會按照三維幾何關系映射到當前視角的對應位置,而非保留原始圖像坐標,最終形成了統一的幾何感知世界建模框架。
![]()
在交互式開放世界中,靜態環境需要穩定的空間結構,動態主體則需要保持身份與外觀的連貫性。如果將兩者混合存儲,移動的人物、車輛很容易在記憶中留下重影,造成場景污染。
對此,Matrix-Game 3.5 采用動靜解耦的雙分支記憶設計,靜態場景分支由 Patch Memory 負責,存儲建筑、地形、固定物體等穩定的空間結構,保障場景的空間一致性;動態主體分支由主體參考 Token 負責,系統從數據中提取多視角、多姿態的主體參考圖,編碼為獨立 Token 貫穿生成全程,維持角色、移動物體的身份與外觀一致性。
通過動態物體檢測、分割與深度判斷,系統會自動區分靜止與運動物體,運動的主體不會被寫入 Patch Memory,從根源上避免了重影、錯位等長時序記憶污染問題。
昆侖萬維構建了三條自動化數據生產管線,形成了支撐世界模型迭代的 「無限數據引擎」:
![]()
配合自動化的相機位姿與米制深度標注、視頻 Prompt 自動標注,以及 Scene-Quality 多維度數據質量評估系統,整套數據基建實現了從數據發現、處理到質量篩選的閉環,解決了世界模型訓練數據成本高、標注難、規模不足的行業痛點。
在工程化落地層面,Matrix-Game 3.5 通過系統級優化,實現了小參數模型的高性能實時運行:其僅 5B 參數量的模型,可在單張 GPU 上實現 720P 分辨率下約 20FPS 的實時流式生成。
縱觀本屆 WAIC 的世界模型相關發布,多數方案要么是閉源的研究級產品,要么是垂直場景的定制化方案,而 Matrix-Game 3.5 走出了一條「開源普惠 + 通用基座」的差異化路線。
- Matrix-Game 3.5 開源地址:https://github.com/Riemann-Dynamics/Matrix-Game-3.5
開源促進了前沿技術的發展。此前,DiT 作者、紐約大學助理教授謝賽寧團隊基于 Matrix-Game 2.0 的開源底座,發布了全球首個多人視頻世界模型 Solaris,也從學術圈的實際使用上印證了這套開源方案的基礎模型價值。英偉達和浙大聯合發布的工作 Light Interaction 基于 Matrix-Game 3.0 模型進行研發。另外,英偉達的 SANA-WM 和 Adobe 的 RELIC 等國際頭部大廠世界模型工作均將 Matrix-Game 相關模型作為對比基準。
學術圈的認可印證了這套開源方案的價值。
在應用端,Matrix-Game 系列也為各產業提供了一套可直接復用的世界模型基礎能力:游戲廠商可以基于它快速生成可交互的游戲世界與場景內容;數字孿生與虛擬仿真領域可以用它構建實時動態的虛擬場景;具身智能企業則可以將其作為機器人的仿真訓練環境,加速策略迭代。
更重要的是,作為昆侖萬維全模態矩陣的技術基座,Matrix-Game 3.5 所構建的世界認知能力,正在向上向下延伸。這種統一基座帶來的技術協同效應,是全模態布局的核心優勢所在。
Mureka V9.5+O3,當 AI 音樂擁有「反思能力」
AI 音樂的尷尬其實和 AI 視頻、機器人本質上類似:它能生成旋律,卻不懂音樂的情緒邏輯,能堆出滿編配,卻不知道何時該留白。聽起來什么都有,就是少了「人味」。
今年 4 月剛在全球權威評測中拿下冠軍的 Mureka 系列這次帶來了 V9.5 與 O3 版本,讓 AI 能像人類創作者一樣理解音樂的情緒、結構與審美邏輯。
這一次,昆侖萬維決定主動克制編配密度,在真實音樂的框架內打磨細節,最終形成了更有人味的鮮明特質。
這種改進建立在 MusiCoT(音樂思維鏈)的系統能力上,其核心是讓模型在生成音頻前先形成完整的音樂思維,從全曲結構到局部表達逐層推進。V9.5 模型進一步將真實音樂的創作邏輯注入這套思維體系:編配不必時刻拉滿,聲部需要呼吸空間,情緒推進要有起承轉合,所有的聲音選擇都服務于最初的創作意圖,而非為了炫技而堆疊。
昆侖萬維用 100 首同口徑評測數據印證了這一審美轉向的實際效果:其人聲表現良品率達到 61.0%,較前代提升 8%,自然度和表達都更接近真人演唱;指令遵循上,Prompt 控制良品率達 97.0%,曲風完全體現比例達 95.7%;最后,音質類良品率均值 35.0%、綜合可用率 28.0%,在克制編配的前提下依然取得了同輪最優,真實感并沒有以犧牲穩定性為代價。
值得注意的是,V9.5 在音樂性均值上并非同輪最高,這種主動取舍跳出了「AI 音樂比誰更熱鬧」的競爭,開始向專業創作的審美標準靠攏。
O3 模型則更進一步,通過 test-time scaling 技術為 AI 音樂注入了反思能力,能像人類創作者一樣邊創作邊審視,發現偏差就及時修正。
從技術邏輯上看,O3 建立在 V9.5 的真實感底座之上,通過推理階段的算力擴展,延伸了 MusiCoT 的思維鏈條:在生成過程中,模型會持續圍繞最初的全曲目標,反復審視當前的局部表達,一旦發現偏差,模型就會對后續的生成決策進行校準,讓作品逐步向更完整、更自洽的方向收斂。
在引入 test-time scaling 后,O3 使 AI 生成音樂的聽感良品率從 35% 提升至 43%,人聲表現良品率從 60% 提升至 68%,綜合可用率也從 35% 提升到 39%,證明了「音樂思維鏈 + 推理擴展」的組合具備持續提升作品質量的空間,也為 AI 音樂的后續升級指明了方向。
在昆侖萬維的活動中,知名演員黃曉明也發表了對于 Mureka 的看法,他表示:「今天早上還讓它生成了兩首歌,很不錯。因為很喜歡楊宗緯的風格,就讓他照著空白格生成了一首抒情歌曲……也讓它生成了一首中年危機的歌。還不錯,詞還挺觸動人心的。」
一線藝人對于 Mureka 的主動試用并公開認可,代表了文娛產業從業者對國產 AI 音樂模型的接納。
在音樂創作方面不斷深耕的 Mureka 正在向專業創作的標準靠攏:當 AI 音樂擺脫了玩具感,真正具備專業創作潛力時,它對影視、音樂、游戲等內容產業的重構才算得上正式開始。
結語
站在 2026 年 WAIC 的節點回望,這一年大概率會被標記為世界模型發展的分水嶺。
這也是昆侖萬維 AI 戰略迭代的一個關鍵節點。基于率先定義「世界模型元年」的思考,其推出打通數字與物理世界的統一認知底座,正在推動 AI 產業的演進節奏,提前布局下一代 AI 主戰場。
或許,當 AI 能在數字世界生成時空自洽的開放場景,能在創作領域理解情緒與結構的審美,能在物理世界完成泛化的復雜操作,屬于世界模型的時代就真的開始了。
這場由世界模型驅動的多模態范式躍遷,最終可能會像曾經的移動互聯網、最近的大語言模型一樣,徹底地滲透進內容、文娛、工業、生活的每一處角落。
我們剛剛見證的,只是這場變革的第一幕。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.