具身世界模型賽道正在發生顯著變化,從“生成未來”走向“理解因果”。
通用視頻生成模型正在不斷突破逼真度的上限,從物體運動到光影反射,都能渲染得惟妙惟肖。初看上去,這與具身智能所需的世界模型似乎只有一步之遙。
然而,恰恰是這一步之遙,成了難以跨越的鴻溝。視覺上流暢自然的視頻,一進入動作邏輯驗證,就頻繁出現穿模、受力缺失和因果矛盾,最終在物理世界中完全失效。
這是當前全球具身世界模型賽道的集體困境:我們到底需要什么樣的世界模型?
近日,由清華大學牽頭,聯合普林斯頓大學、新加坡國立大學、北京大學等多所學術機構聯合打造的具身世界模型權威基準WorldArena更新榜單。莫刻機器人以自研的LJM(Latent Joint-conditional Model,隱空間聯合條件建模)模型,取得73.06分的綜合成績,位列全球第二,僅與榜首相差0.58分。更具行業標志性意義的是,這套頂尖具身基座的全流程訓練,僅使用32張阿里云真武810E。
從“靠通用視覺先驗打補丁”到“在隱空間構建因果體系”,莫刻機器人正在給出一條AI原生的具身世界模型技術路線,也開辟了國產化自主研發的新路徑。
01.
視覺流暢≠物理可信:通用視頻路線的短板
當前具身模型的卡點在于視頻看起來流暢自然,物理邏輯卻經常出錯。模型能畫出逼真的機械臂運動,卻不懂“動作-接觸-物體狀態變化”之間的因果關系,自然無法支撐嚴肅的策略預演。
真實物理世界中機器人交互關心的是物理因果邏輯:夾爪閉合后物體是否被提起?推力施加后物體會滑動多遠?遮擋消失后物體是否還在原位?這些占比極小、持續時間極短的接觸與狀態變化,在海量視頻數據中很容易被背景、紋理、光照等占比更大的信息稀釋。
更核心的矛盾在于,現有方案始終把動作當成“外部附加條件”,而非“交互的核心變量”。只把動作數值塞進模型,卻不讓模型理解其交互語義,本質還是“照著參數畫畫”,而非“推演物理變化”。
長時序生成的記憶漂移問題則進一步放大了缺陷。多數模型以固定窗口保留最近幾幀作為上下文,但機器人操作是典型的部分可觀測場景:抓取瞬間的狀態、物體被遮擋前的位置、中間放置的結果,這些關鍵信息往往不在“最近幾幀”里。模型只記得眼前看到的畫面,卻忘了之前發生過什么,生成序列越長,前后邏輯矛盾就越嚴重。
02.
LJM技術拆解:先推演因果、再生成世界
莫刻機器人的LJM,恰恰從底層架構上跳出了“通用視頻+動作補丁”的路徑依賴。它的核心洞察非常明確:世界模型要先理解交互的因果,再生成視覺畫面。而理解因果的載體,就是統一的交互隱空間。
簡單來說,LJM不是“給視頻模型喂動作參數”,而是先把語言指令、視覺上下文、動作序列全部映射到同一個連續隱空間里,在這個空間里完成物理交互的推演,再用推演結果約束視頻生成。這套邏輯落地為一套精巧的“雙專家+強監督+長記憶”技術體系。
![]()
雙專家協同:推演與渲染逐層交互
LJM架構由兩大核心模塊組成:Latent Reasoning Expert(隱空間推理專家)與World Modeling Expert(世界建模專家)。
推理專家負責“想清楚”:它基于多模態輸入,在連續隱空間中預測機器人本體狀態變化、物體運動趨勢、場景狀態演化。它不輸出像素,只輸出抽象的交互邏輯表征,相當于模型的“物理推演大腦”。
建模專家負責“畫出來”:它以視頻擴散Transformer為骨干,在推理專家給出的隱空間約束下,生成高保真的未來視覺視頻,相當于模型的“渲染引擎”。
與傳統“先推理后生成”的串行架構不同,LJM通過MoT(Mixture-of-Transformers)共享注意力機制,讓兩個專家在每一層網絡中都進行雙向信息交互。推理專家把物理約束逐層傳遞到生成過程中,建模專家也把視覺特征實時反饋給推理端。二者同步迭代、互相校準,確保生成的每一秒畫面,都嚴格符合推演的物理邏輯,而不是前后脫節的“兩張皮”。
與此同時,原始動作序列還通過交叉注意力、AdaLN兩條路徑直接作用于建模專家,提供底層的數值級精準控制。高層物理解釋+低層動作約束,共同構成了從“動作輸入”到“交互語義”再到“視覺輸出”的完整通路。
顯式監督:讓隱空間真正對應物理事實
如果沒有明確監督,隱空間表征很容易退化為普通的多模態特征,失去物理推演能力。LJM的解決思路是:用真實物理信號給每一個隱空間token“批改作業”。
團隊從真實軌跡數據中提取了本體狀態、像素運動、視覺動態三類監督信號,按時間維度交錯排列,共同構成交互隱空間的學習目標。
三者共同作用,使得隱空間中的每一個 token 都同時受到來自“自身動作”“環境運動”和“全局變化”的多重約束——模型若要同時擬合這三類信號,就不能依賴統計上的像素相關性,而必須真正捕捉它們背后的因果鏈條。這種多視角、多粒度的聯合監督,迫使隱空間表征扎根于具體的物理量,而非抽象的視覺特征。
價值驅動時序:記住關鍵的,而非最近的
針對長時序生成的記憶漂移難題,LJM提出了VTC(Value-driven Temporal Conditioning,價值驅動時序條件)機制。
它不再機械地保留最近N幀,而是主動評估每一幀的信息價值:既考慮幀與幀之間的差異度,避免冗余;也優先保留狀態轉折的關鍵幀,比如抓取發生的瞬間、物體放置完成的時刻。同時始終保留初始幀作為全局空間參考。
這種“主動選關鍵幀”的模式,適配機器人操作的部分可觀測特性。物體被遮擋了沒關系,模型記得它被擋住前的位置;操作步驟多也沒關系,關鍵的狀態節點都被保留了下來。實測對比顯示,引入VTC后,長序列生成中的物體消失、位置偏移、邏輯矛盾等問題大幅減少,時序一致性顯著提升。
03.
數據說話:WorldArena全球第二+LIBERO四項SOTA
WorldArena與LIBERO兩大權威基準的測試結果,共同驗證了LJM路線的技術優越性。
作為目前全球具身世界模型領域最受認可的第三方公開基準,WorldArena從視覺質量、運動質量、內容一致性、物理遵循、三維精度、可控性六大維度進行綜合評估,收錄了全球上百個提交方案,具備極強的橫向對比價值。
LJM以匿名代號SisyphusWorld提交,最終以73.06的綜合得分位列全球第二,僅與榜首相差0.58分,穩居世界第一梯隊。
![]()
更值得關注的是分項成績:運動質量89.17分、三維精度92.60分、動作可控性85.93分。這三項恰恰是機器人交互場景的核心指標——動作執行是否精準、空間結構是否準確、指令控制是否可控,直接決定了世界模型能不能用于策略預演。
對比同期的通用視頻基線模型,差距更為直觀:Wan2.2綜合得分62.35,CogVideoX 得分62.71,與LJM有超過10分的差距。
與此同時,在更能檢驗模型的泛化能力與真實交互建模水平的LIBERO榜單中,莫刻機器人LJM多項核心指標達到SOTA水平。
在100組獨立測試任務上,LJM四項核心指標全部登頂,全面超越主流基線:
PSNR 28.60(提升約5%)
SSIM 0.9238(提升約4.7%)
FVD 46.49(時序失真指標下降約39.7%)
LPIPS 0.0247(感知誤差下降約61.3%)
![]()
FVD和LPIPS的大幅下降尤為關鍵。PSNR和SSIM衡量的是單幀畫面的相似度,而FVD衡量整段視頻的時序分布一致性,LPIPS衡量人類視覺感知下的真實度。這兩個指標的顯著優化,意味著LJM生成的不只是“單幀像”的畫面,更是“從頭到尾都符合物理邏輯”的完整交互序列,幾乎沒有穿模、跳變、物體憑空消失等常見問題。
換句話說,這才是世界模型真正的落地價值:機器人可以放心地在里面預演策略,因為模型預判的結果,和真實世界執行的結果高度一致。
04.
32張真武810E:探索具身世界模型的本土化訓練鏈路
在算法突破之外,LJM的另一重行業價值,在于探索了國內算力支撐頂尖具身世界模型的可行性。
長期以來,大模型研發高度依賴進口高端算力芯片,具身世界模型作為多模態大模型的前沿方向,數據模態多、訓練流程復雜,算力門檻更高。國產算力能不能跑、好不好用、能不能跑出世界級效果,部分業內人士心存疑慮。
莫刻機器人從大規模多模態數據預處理、基座模型預訓練,到下游任務微調,LJM的全套訓練流程全部部署在32張阿里云真武810E之上,初步跑通了具身世界模型的本土化訓練鏈路。
針對國產算力的硬件特性,團隊在分布式并行調度、混合精度適配、訓練流優化上做了大量工程工作,讓LJM的架構優勢與算力特性充分匹配,最終在有限的算力規模下,收斂出了世界級的模型性能。
這一實踐的意義遠超單個企業本身。它為國內整個具身智能行業提供了一條可復用、可落地的本土化算力方案:不靠堆進口高端卡,靠架構創新和工程優化,完全可以支撐頂尖具身世界模型的研發。這對于降低行業算力成本、保障技術供應鏈自主可控,都具有標志性的標桿意義。
05.
結語
LJM的亮眼表現,也呈現出世界模型的技術競賽正發生的范式轉移趨勢。
過去,行業對世界模型的評判標準往往停留在畫面層次。莫刻團隊認為,機器人要真正進入物理世界,必須擁有理解世界的能力。對于要落地到真實產線的策略預演而言,畫面渲染只是表層,對動作與環境的因果交互進行精確推理,才是具身世界模型不可替代的核心價值。
LJM的技術路線恰恰指向這個方向:它不是再增加一個動作適配器,而是在低維控制與高維視覺之間建立了一層可監督、可交互、可記憶的latent interface。語言定義任務,歷史視覺提供狀態,動作描述控制,latent reasoning預測交互后果,視頻擴散模型再把后果生成出來。
當世界模型的技術競賽從純視覺生成走向“理解交互再生成”的范式,當國產算力從“能不能用”走向“能不能打”,莫刻機器人的這次嘗試,是行業邁出的關鍵一步。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.