編輯|澤南
刷短視頻時,我們吐槽 AI 視頻的 bug;聽 AI 寫的歌,總覺得缺了「人味」;仔細看機器人的 demo,會發(fā)現(xiàn)它們其實還不太會做家務(wù)……人工智能這些看似不相關(guān)的短板,本質(zhì)上都指向同一個問題:它們還沒有真正理解真實世界的運行規(guī)律。
這個困擾全行業(yè)的難題,在 WAIC 得到了一份體系化的回答。7 月 19 日,一場專場論壇上,昆侖萬維董事長兼 CEO 方漢提出一個核心論斷:2026 年是世界模型元年。
支撐這句論斷的,是一套橫跨虛擬與物理世界的全模態(tài)模型矩陣。
![]()
當(dāng) AI 擁有了對真實世界的統(tǒng)一認(rèn)知能力,數(shù)字內(nèi)容創(chuàng)作與物理世界交互的邊界,都將被徹底重構(gòu)。
今年的 WAIC,世界模型成為勝負手
作為 AI 產(chǎn)業(yè)的年度風(fēng)向標(biāo),世界人工智能大會(WAIC)的熱鬧肉眼可見:1100 余家參展企業(yè)、超 300 款全球首發(fā)產(chǎn)品,幾乎所有主流科技公司都把年度壓箱底的成果搬來了現(xiàn)場。熱鬧的展區(qū)背后,整個行業(yè)的路線分野已經(jīng)非常清晰。
算力賽道在卷集群規(guī)模:華為拿出 8192 張卡組成的昇騰超節(jié)點,中科曙光、沐曦等廠商扎堆上新超算產(chǎn)品,比的是萬卡級集群的工程能力與算力密度;機器人賽道在卷硬件形態(tài):智元推重載人形,啟元做可變形機器人,多數(shù)玩家仍在本體性能、特定場景專用性上貼身肉搏;大模型賽道在卷參數(shù)效率:月之暗面的 2.8 萬億開源模型 Kimi K3,讓國內(nèi)模型與世界第一的差距已經(jīng)從 3-6 個月縮短到了幾周。
作為 AI 領(lǐng)域最前沿的方向,世界模型也正在從學(xué)術(shù)概念走向產(chǎn)業(yè)落地。但多數(shù)玩家仍停留在垂直場景的單點嘗試:有人做 AI 影視,有人做植物仿真,卻很少有人回答一個最根本的問題:能不能用一套統(tǒng)一的世界認(rèn)知能力,同時解決數(shù)字內(nèi)容、具身智能等多個領(lǐng)域的底層難題?
其實,有人早在四年前就開始布局這條路線。
今天昆侖萬維的集中發(fā)布是其 AI 戰(zhàn)略四年演進的關(guān)鍵里程碑:從 2022 年確立 All in AGI 與 AIGC 戰(zhàn)略,率先押注全模態(tài)內(nèi)容生成賽道,到 2026 年方漢正式提出「世界模型元年」的行業(yè)判斷,昆侖萬維完成了從多模態(tài)內(nèi)容生成到可交互世界模型的戰(zhàn)略躍遷,不再滿足于讓 AI 生成孤立的文本、圖像、音頻內(nèi)容,希望通過讓 AI 真正理解世界的運行規(guī)則,構(gòu)建打通數(shù)字內(nèi)容與物理實體的統(tǒng)一認(rèn)知底座。
在所有參展企業(yè)中,昆侖萬維是唯一一家在同一場論壇中,集中發(fā)布橫跨世界模型基座、數(shù)字內(nèi)容創(chuàng)作、具身智能三大領(lǐng)域的全模態(tài)模型矩陣的企業(yè)。
這套全模態(tài)布局有著清晰的邏輯:
- 在物理世界層面,由Riemann-1.0 具身動作模型將時空理解能力延伸到機器人控制,構(gòu)建了跨本體泛化的機器人通用大腦;
- 在基座層,Matrix-Game 3.5 實時交互世界模型打造底層認(rèn)知能力,嘗試解決世界模型的長時序一致性與實時交互難題;
- 在數(shù)字內(nèi)容層,Mureka V9.5 與 O3把認(rèn)知與推理能力落地到音樂創(chuàng)作領(lǐng)域,推動了 AI 音樂從生成工具向創(chuàng)作范式升維。
從虛擬到物理,從基座到場景,一套完整的世界模型落地體系已然成型。
Riemann-1.0,做機器人的 「通用大腦」
這一路線的價值,先在最復(fù)雜的物理世界得到了驗證。
很長一段時間里,具身智能都逃不出僅限 Demo 的尷尬:換個桌面、換件衣服,它就不會操作了,長流程任務(wù)更是頻頻出錯。問題的根源在于 AI 不懂物理規(guī)則,也沒有泛化能力,換個場景就得重新學(xué)。
WAIC 上,昆侖萬維旗下獨立公司黎曼機器人帶來的 Riemann-1.0 正在打破這個困局。
現(xiàn)場演示中,它能穩(wěn)定完成有序積木堆疊:
![]()
能處理物件繁雜的廚房整理:
![]()
Riemann-1.0 將世界模型的能力邊界從數(shù)字世界延伸到了物理世界,致力于打造一款可跨本體、跨任務(wù)、跨場景的 World Action Model(世界動作模型),成為所有機器人的通用大腦。
在 Riemann-1.0 之前,機器人智能的技術(shù)路線已經(jīng)歷了兩代演進:第一代是專用策略模型,針對特定任務(wù)、單一機器人本體端到端訓(xùn)練,泛化能力差、訓(xùn)練效率低;第二代是 VLA(視覺 - 語言 - 動作)模型,引入大語言模型的語義理解能力,把「看懂任務(wù)」和動作生成連接起來,但仍缺乏對物理時空動態(tài)的深層理解。
Riemann-1.0 所代表的第三代路線 WAM(世界動作模型)如今更進一步,將機器人動作生成、環(huán)境狀態(tài)演化與未來多視角視覺預(yù)測納入同一個因果生成框架,讓模型同時掌握執(zhí)行動作的策略與預(yù)判視覺后果的能力,實現(xiàn)世界理解、未來預(yù)測與閉環(huán)控制的一體化學(xué)習(xí)。
具體到架構(gòu)設(shè)計上,Riemann-1.0 構(gòu)建了統(tǒng)一的動作 - 視頻聯(lián)合建模體系:
![]()
模型以 Wan2.2 latent-space DiT 為主干,在繼承其高質(zhì)量視頻潛空間建模能力的基礎(chǔ)上,進一步引入動作 token、狀態(tài) token、本體專屬映射模塊以及動作預(yù)測頭,實現(xiàn)了對不同機器人形態(tài)、傳感器配置和連續(xù)動作空間的統(tǒng)一適配。
這種設(shè)計的核心價值在于讓機器人具備了「預(yù)判動作后果 - 實時修正決策」的主動認(rèn)知能力。
為此在數(shù)據(jù)基建上,Riemann-1.0 構(gòu)建了一套覆蓋三類來源的多源數(shù)據(jù)聚合矩陣,包括人類第一視角視頻、UMI / 外骨骼手套數(shù)據(jù)以及機器人軌跡數(shù)據(jù),總規(guī)模達 23.2 萬小時,解決了數(shù)據(jù)規(guī)模、泛化性與監(jiān)督精度三大問題。
![]()
為了將異質(zhì)性極強的多源數(shù)據(jù)轉(zhuǎn)化為可統(tǒng)一訓(xùn)練的高質(zhì)量樣本,團隊搭建了全自動的六階數(shù)據(jù)清洗引擎,首次驗證了「海量人類視頻預(yù)訓(xùn)練 + 少量機器人數(shù)據(jù)微調(diào)」的技術(shù)路徑可行性,用低成本、規(guī)模化的人類交互數(shù)據(jù)嘗試解決泛化問題。
在訓(xùn)練上,Riemann-1.0 采用了三階段漸進式策略: LAM 偽動作預(yù)訓(xùn)練 + 真實動作監(jiān)督訓(xùn)練 + 機器人策略增強訓(xùn)練。
無論是仿真基準(zhǔn)還是真機實測,Riemann-1.0 都展現(xiàn)出了顯著的領(lǐng)先優(yōu)勢,尤其在長時序操作、視覺泛化與跨場景遷移等體現(xiàn)通用能力的維度上優(yōu)勢突出。其在 LIBERO 基準(zhǔn)上成功率達到 99.0%,處于行業(yè)第一梯隊;RoboCasa-365 基準(zhǔn)成功率達 62.6%,領(lǐng)先此前 SOTA 模型 8.4%;RoboTwin2.0 基準(zhǔn):成功率達 94.3%,展現(xiàn)了穩(wěn)定的雙端聯(lián)合建模能力。
更具說服力的是人類數(shù)據(jù)有效性的消融實驗:在相同機器人示教數(shù)據(jù)量的前提下,加入人類第一視角數(shù)據(jù)預(yù)訓(xùn)練后,模型在長程已見場景的成功率提升了 28.15%,長程未見場景提升了 16.97%;對比業(yè)界基線 EgoVLA,Riemann-1.0 在長程任務(wù)上領(lǐng)先幅度超過 25%。
這證明新模型的性能提升源于通用世界理解能力的增強,人類交互經(jīng)驗確實能夠有效轉(zhuǎn)化為機器人的操作泛化能力。
機器人能在物理世界做到穩(wěn)定泛化,本質(zhì)上依賴的是對空間、幾何、因果的底層認(rèn)知能力,這套能力的源頭來自昆侖萬維打磨多年的數(shù)字世界基座。
Matrix-Game 3.5,破解世界模型長時序一致性難題
從視頻生成到世界模型,近期整個行業(yè)一直卡在同一個瓶頸:AI 只能生成短時間連貫的畫面,鏡頭一轉(zhuǎn)、場景一換,結(jié)構(gòu)就亂了。想要做實時交互的開放世界,更是會出現(xiàn)空間錯位、物體穿模、記憶丟失等一系列問題。
WAIC 現(xiàn)場展示的 Matrix-Game 3.5,正在把可交互的開放世界從概念變成可落地的基礎(chǔ)設(shè)施。
它可以生成結(jié)構(gòu)自洽、可自由探索的復(fù)雜物理場景:
![]()
也能生成空間精準(zhǔn)、支持實時交互的 FPS 游戲地圖:
![]()
作為全模態(tài)模型矩陣的基座層核心,Matrix-Game 3.5 是整套技術(shù)體系的「世界認(rèn)知底座」。它是一款能夠持續(xù)交互、具備長期空間記憶的實時流式世界模型。其核心目標(biāo)是推動 AI 進化成為能生成可持續(xù)探索交互,且時空自洽的開放世界。
這也是行業(yè)公認(rèn)的下一代 AI 演進方向。
![]()
近幾年來,世界模型的技術(shù)路線經(jīng)歷了清晰的代際變革:2023-2024 年以 Sora、Veo 為代表的視頻模型爆發(fā),到 DeepMind Genie 系列逐步實現(xiàn)了從 2D 到 3D、從離線到實時交互的突破,全行業(yè)正在進入「可交互世界」的新階段。
在這個過程中,Matrix-Game 系列始終沿著開源可落地的路線同步推進:從業(yè)內(nèi)首個實現(xiàn)單卡實時交互的 Matrix-Game 2.0,到首個系統(tǒng)性解決記憶問題的 3.0 版。本次升級的 3.5 版正在將世界模型轉(zhuǎn)化為可被產(chǎn)業(yè)低成本復(fù)用的通用基礎(chǔ)設(shè)施。
Matrix-Game 3.5 從記憶機制、幾何編碼到動靜關(guān)系完成了底層架構(gòu)升級,系統(tǒng)解決了長期困擾世界模型的長時序一致性差、相機控制不穩(wěn)、動態(tài)物體易失真三大核心痛點。
首先是長時序生成的場景一致性。此前行業(yè)主流的 Frame 級記憶方案要么以整幀特征為記憶單元,跨視角對齊精度不足;要么依賴全局三維重建,靈活性差且容易累積全局誤差。
Matrix-Game 3.5 帶來的 Patch Memory 技術(shù)兼顧精度與靈活性,它將歷史圖像切分為多個局部 Patch,結(jié)合米制深度與相機位姿,把每個 Patch 反投影到三維世界坐標(biāo)系中存儲。當(dāng)生成新視角畫面時,再根據(jù)當(dāng)前相機視錐,檢索可見區(qū)域的歷史 Patch 并重新投影到目標(biāo)視角,形成空間記憶畫布注入模型。
這套機制帶來了更精準(zhǔn)的空間記憶、更高的自由度、靈活的場景編輯能力,以及穩(wěn)定的長時間生成。
另一方面,傳統(tǒng)視頻模型依賴的 3D RoPE 僅能編碼時間與二維空間位置,無法表達不同視角間的真實幾何關(guān)系,這會導(dǎo)致 AI 生成視頻常出現(xiàn)相機運動混亂、視角邏輯不自洽的問題。
Matrix-Game 3.5 創(chuàng)新性地提出了 PRoPE(相機位姿相對編碼)方案,其直接將相機投影矩陣融入 Transformer 的位置編碼體系,讓視角幾何關(guān)系成為注意力機制的天然組成部分。模型在建立跨幀關(guān)聯(lián)時,不僅能理解時序與空間位置,更能感知不同視角間的旋轉(zhuǎn)、平移與投影關(guān)系,從而實現(xiàn)更穩(wěn)定、更精確的相機運動控制。
這套方案無需增加模型參數(shù),最大程度保留了基礎(chǔ)視頻模型的原生生成能力,同時可快速遷移適配不同的視頻基座模型。配合 Warped RoPE,記憶 Patch 會按照三維幾何關(guān)系映射到當(dāng)前視角的對應(yīng)位置,而非保留原始圖像坐標(biāo),最終形成了統(tǒng)一的幾何感知世界建模框架。
![]()
在交互式開放世界中,靜態(tài)環(huán)境需要穩(wěn)定的空間結(jié)構(gòu),動態(tài)主體則需要保持身份與外觀的連貫性。如果將兩者混合存儲,移動的人物、車輛很容易在記憶中留下重影,造成場景污染。
對此,Matrix-Game 3.5 采用動靜解耦的雙分支記憶設(shè)計,靜態(tài)場景分支由 Patch Memory 負責(zé),存儲建筑、地形、固定物體等穩(wěn)定的空間結(jié)構(gòu),保障場景的空間一致性;動態(tài)主體分支由主體參考 Token 負責(zé),系統(tǒng)從數(shù)據(jù)中提取多視角、多姿態(tài)的主體參考圖,編碼為獨立 Token 貫穿生成全程,維持角色、移動物體的身份與外觀一致性。
通過動態(tài)物體檢測、分割與深度判斷,系統(tǒng)會自動區(qū)分靜止與運動物體,運動的主體不會被寫入 Patch Memory,從根源上避免了重影、錯位等長時序記憶污染問題。
昆侖萬維構(gòu)建了三條自動化數(shù)據(jù)生產(chǎn)管線,形成了支撐世界模型迭代的 「無限數(shù)據(jù)引擎」:
![]()
配合自動化的相機位姿與米制深度標(biāo)注、視頻 Prompt 自動標(biāo)注,以及 Scene-Quality 多維度數(shù)據(jù)質(zhì)量評估系統(tǒng),整套數(shù)據(jù)基建實現(xiàn)了從數(shù)據(jù)發(fā)現(xiàn)、處理到質(zhì)量篩選的閉環(huán),解決了世界模型訓(xùn)練數(shù)據(jù)成本高、標(biāo)注難、規(guī)模不足的行業(yè)痛點。
在工程化落地層面,Matrix-Game 3.5 通過系統(tǒng)級優(yōu)化,實現(xiàn)了小參數(shù)模型的高性能實時運行:其僅 5B 參數(shù)量的模型,可在單張 GPU 上實現(xiàn) 720P 分辨率下約 20FPS 的實時流式生成。
縱觀本屆 WAIC 的世界模型相關(guān)發(fā)布,多數(shù)方案要么是閉源的研究級產(chǎn)品,要么是垂直場景的定制化方案,而 Matrix-Game 3.5 走出了一條「開源普惠 + 通用基座」的差異化路線。
- Matrix-Game 3.5 開源地址:https://github.com/Riemann-Dynamics/Matrix-Game-3.5
開源促進了前沿技術(shù)的發(fā)展。此前,DiT 作者、紐約大學(xué)助理教授謝賽寧團隊基于 Matrix-Game 2.0 的開源底座,發(fā)布了全球首個多人視頻世界模型 Solaris,也從學(xué)術(shù)圈的實際使用上印證了這套開源方案的基礎(chǔ)模型價值。英偉達和浙大聯(lián)合發(fā)布的工作 Light Interaction 基于 Matrix-Game 3.0 模型進行研發(fā)。另外,英偉達的 SANA-WM 和 Adobe 的 RELIC 等國際頭部大廠世界模型工作均將 Matrix-Game 相關(guān)模型作為對比基準(zhǔn)。
學(xué)術(shù)圈的認(rèn)可印證了這套開源方案的價值。
在應(yīng)用端,Matrix-Game 系列也為各產(chǎn)業(yè)提供了一套可直接復(fù)用的世界模型基礎(chǔ)能力:游戲廠商可以基于它快速生成可交互的游戲世界與場景內(nèi)容;數(shù)字孿生與虛擬仿真領(lǐng)域可以用它構(gòu)建實時動態(tài)的虛擬場景;具身智能企業(yè)則可以將其作為機器人的仿真訓(xùn)練環(huán)境,加速策略迭代。
更重要的是,作為昆侖萬維全模態(tài)矩陣的技術(shù)基座,Matrix-Game 3.5 所構(gòu)建的世界認(rèn)知能力,正在向上向下延伸。這種統(tǒng)一基座帶來的技術(shù)協(xié)同效應(yīng),是全模態(tài)布局的核心優(yōu)勢所在。
Mureka V9.5+O3,當(dāng) AI 音樂擁有「反思能力」
AI 音樂的尷尬其實和 AI 視頻、機器人本質(zhì)上類似:它能生成旋律,卻不懂音樂的情緒邏輯,能堆出滿編配,卻不知道何時該留白。聽起來什么都有,就是少了「人味」。
今年 4 月剛在全球權(quán)威評測中拿下冠軍的 Mureka 系列這次帶來了 V9.5 與 O3 版本,讓 AI 能像人類創(chuàng)作者一樣理解音樂的情緒、結(jié)構(gòu)與審美邏輯。
這一次,昆侖萬維決定主動克制編配密度,在真實音樂的框架內(nèi)打磨細節(jié),最終形成了更有人味的鮮明特質(zhì)。
這種改進建立在 MusiCoT(音樂思維鏈)的系統(tǒng)能力上,其核心是讓模型在生成音頻前先形成完整的音樂思維,從全曲結(jié)構(gòu)到局部表達逐層推進。V9.5 模型進一步將真實音樂的創(chuàng)作邏輯注入這套思維體系:編配不必時刻拉滿,聲部需要呼吸空間,情緒推進要有起承轉(zhuǎn)合,所有的聲音選擇都服務(wù)于最初的創(chuàng)作意圖,而非為了炫技而堆疊。
昆侖萬維用 100 首同口徑評測數(shù)據(jù)印證了這一審美轉(zhuǎn)向的實際效果:其人聲表現(xiàn)良品率達到 61.0%,較前代提升 8%,自然度和表達都更接近真人演唱;指令遵循上,Prompt 控制良品率達 97.0%,曲風(fēng)完全體現(xiàn)比例達 95.7%;最后,音質(zhì)類良品率均值 35.0%、綜合可用率 28.0%,在克制編配的前提下依然取得了同輪最優(yōu),真實感并沒有以犧牲穩(wěn)定性為代價。
值得注意的是,V9.5 在音樂性均值上并非同輪最高,這種主動取舍跳出了「AI 音樂比誰更熱鬧」的競爭,開始向?qū)I(yè)創(chuàng)作的審美標(biāo)準(zhǔn)靠攏。
O3 模型則更進一步,通過 test-time scaling 技術(shù)為 AI 音樂注入了反思能力,能像人類創(chuàng)作者一樣邊創(chuàng)作邊審視,發(fā)現(xiàn)偏差就及時修正。
從技術(shù)邏輯上看,O3 建立在 V9.5 的真實感底座之上,通過推理階段的算力擴展,延伸了 MusiCoT 的思維鏈條:在生成過程中,模型會持續(xù)圍繞最初的全曲目標(biāo),反復(fù)審視當(dāng)前的局部表達,一旦發(fā)現(xiàn)偏差,模型就會對后續(xù)的生成決策進行校準(zhǔn),讓作品逐步向更完整、更自洽的方向收斂。
在引入 test-time scaling 后,O3 使 AI 生成音樂的聽感良品率從 35% 提升至 43%,人聲表現(xiàn)良品率從 60% 提升至 68%,綜合可用率也從 35% 提升到 39%,證明了「音樂思維鏈 + 推理擴展」的組合具備持續(xù)提升作品質(zhì)量的空間,也為 AI 音樂的后續(xù)升級指明了方向。
在昆侖萬維的活動中,知名演員黃曉明也發(fā)表了對于 Mureka 的看法,他表示:「今天早上還讓它生成了兩首歌,很不錯。因為很喜歡楊宗緯的風(fēng)格,就讓他照著空白格生成了一首抒情歌曲……也讓它生成了一首中年危機的歌。還不錯,詞還挺觸動人心的。」
一線藝人對于 Mureka 的主動試用并公開認(rèn)可,代表了文娛產(chǎn)業(yè)從業(yè)者對國產(chǎn) AI 音樂模型的接納。
在音樂創(chuàng)作方面不斷深耕的 Mureka 正在向?qū)I(yè)創(chuàng)作的標(biāo)準(zhǔn)靠攏:當(dāng) AI 音樂擺脫了玩具感,真正具備專業(yè)創(chuàng)作潛力時,它對影視、音樂、游戲等內(nèi)容產(chǎn)業(yè)的重構(gòu)才算得上正式開始。
結(jié)語
站在 2026 年 WAIC 的節(jié)點回望,這一年大概率會被標(biāo)記為世界模型發(fā)展的分水嶺。
這也是昆侖萬維 AI 戰(zhàn)略迭代的一個關(guān)鍵節(jié)點。基于率先定義「世界模型元年」的思考,其推出打通數(shù)字與物理世界的統(tǒng)一認(rèn)知底座,正在推動 AI 產(chǎn)業(yè)的演進節(jié)奏,提前布局下一代 AI 主戰(zhàn)場。
或許,當(dāng) AI 能在數(shù)字世界生成時空自洽的開放場景,能在創(chuàng)作領(lǐng)域理解情緒與結(jié)構(gòu)的審美,能在物理世界完成泛化的復(fù)雜操作,屬于世界模型的時代就真的開始了。
這場由世界模型驅(qū)動的多模態(tài)范式躍遷,最終可能會像曾經(jīng)的移動互聯(lián)網(wǎng)、最近的大語言模型一樣,徹底地滲透進內(nèi)容、文娛、工業(yè)、生活的每一處角落。
我們剛剛見證的,只是這場變革的第一幕。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.