![]()
作者:SY
出品:明亮公司
2026北京智源大會世界模型分論壇上,騰訊混元3D及世界模型負責人郭春超以《混元3D:從物體生成到世界模型的研發探索》為題,系統分享了騰訊混元在3D資產生成、3D生產管線以及HY World系列世界模型方面的最新進展。
隨著World Model成為人工智能領域最熱門的方向之一,行業正沿著視頻生成、具身智能和空間智能等不同路線展開探索。相比從視頻生成出發構建世界模型,騰訊更強調3D資產和三維空間的重要性。
在郭春超看來,世界模型不僅需要“看起來像世界”,更需要進入真實生產流程,服務于游戲開發、數字內容生產和工業仿真等場景。而這些場景背后,都離不開可編輯、可修改、可復用的3D資產。
“僅靠視頻,很難真正進入游戲和工業生產流程。”郭春超表示,視頻路線在視覺表現和動態生成方面具有天然優勢,但如果希望兼容游戲引擎、工業仿真以及內容生產體系,僅有視頻遠遠不夠。世界模型不僅需要生成世界,更需要理解世界、編輯世界,并與現有生產系統相兼容。
因此,在HY World的發展過程中,騰訊始終堅持保留三維空間表達能力。從支持Mesh場景資產導出,到兼容圖形引擎,再到圍繞生成、導航、擴展和重建構建完整的3D世界生成框架,核心目標始終是讓世界模型從展示層走向生產層。
![]()
北京智源大會、騰訊混元(下同)
與此同時,郭春超也指出,當前World Model(世界模型)仍處于非常早期的發展階段。一方面,行業尚未形成統一的評測標準;另一方面,大多數模型雖然能夠實現視覺上的合理生成,但距離真正理解物理規律仍有較大差距。如何從“視覺正確”走向“物理正確”,如何讓模型具備更強的可交互性和決策能力,仍是未來幾年行業需要持續攻克的問題。
在他看來,未來世界模型的發展不會是單一路線的勝出。視頻世界模型與3D世界模型將長期并行發展,而空間智能與語言智能也將逐漸走向融合。
以下為「明亮公司」基于現場速記、演示文稿整理的演講內容:
從3D資產到3D世界
騰訊混元是一個多模態模型家族,覆蓋語言、圖像、視頻、語音以及3D等多個模態,并服務于騰訊內部眾多業務場景。具體到3D方向,我們的發展主要圍繞兩條主線展開。
第一條主線是3D物體生成。從2024年開始,我們持續迭代混元3D系列模型,陸續發布了混元3D 1.0、3D2.0、3D2.5、3D3.0等多個版本。
第二條主線是3D世界模型。從2025年開始,我們持續推進HY World系列模型研發,也是業內較早開源的3D世界生成模型之一。
![]()
整體來看,我們的研發布局圍繞兩部分展開:一是生成式3D資產,二是3D世界模型,希望推動AI 3D技術的發展與商業化落地。
為什么先做3D資產生成
3D資產本質上是連接人與計算機的重要載體。無論是工業設計、數字內容生產、游戲開發,還是機器人仿真,底層都離不開3D資產。過去3D內容生產存在一個明顯問題:門檻高、成本高、專業性強。一個成熟建模師往往需要經過長期訓練,很多企業和團隊難以承擔相關成本。
而AIGC和3D大模型的出現,為3D資產生產帶來了新的可能性。我們認為,3D資產是構成世界的基礎元素,也是距離商業化最近的一環。因此團隊最早并沒有直接切入世界模型,而是先從3D資產生成開始,希望重構3D生成的底層語言。
![]()
目前,3D單體生成已經發展到較好的水平,同時我們也在持續推進3D生產管線的AI化,希望利用AI重塑傳統CG工作流。
從物體生成邁向世界生成
當3D資產生成能力逐步成熟之后,一個自然的問題出現了:能否進一步構建完整的世界?因此我們開始探索3D世界模型。在我們的理解中,世界模型的發展路徑可以概括為:3D資產生成 → 場景生成 → 主體與場景交互 → 世界演化與模擬。最終實現世界的生成、重建、編輯與交互的一體化。
![]()
我們對于“世界”的定義其實很簡單:世界本質上是一個可交互的三維場景。它既可以是虛擬世界,例如游戲、VR以及數字內容場景;也可以是真實世界,例如數字孿生、工業仿真以及機器人場景。
世界模型仍處于早期階段
過去一年,World Model成為行業最熱門的話題之一。隨著具身智能的發展,大量公司開始發布自己的世界模型產品,整個行業也進入快速探索階段。
從我們的觀察來看,目前行業對世界模型的理解并不統一。有人認為視頻模型就是世界模型;有人認為LLM本身也可以被視作一種世界模型;還有人認為空間智能才是世界模型的核心。
![]()
從技術路線來看,目前主要可以分為三類:第一類是交互式視頻世界模型,通過實時生成和預測像素序列完成世界模擬;第二類是顯式3D世界模型,直接構建三維空間幾何結構;第三類是在Latent Space中進行預測和推理的世界模型。
如果進一步擴展定義,把VLA等基于LLM的體系納入進來,也可以認為存在第四類路線。目前整個行業仍然處于百家爭鳴階段,無論是底層架構還是訓練方式,都還沒有完全收斂。
HY World的發展路徑
騰訊較早開始探索世界模型方向。2025年1月,HY World項目正式啟動;2025年7月,我們發布了第一版開源3D世界模型,并支持消費級顯卡部署。隨后團隊陸續推出HY World 1.5和HY World 2.0。其中,HY World 1.5是一套結合2D與3D能力的實時交互世界模型。當時我們實現了24FPS、720P實時生成能力,并將推理延遲控制在1秒左右,是當時國內較早可實時體驗的視頻世界模型之一。
![]()
對于Video-based World Model而言,視頻訓練、視頻推理和視頻展示天然一致,因此視覺效果往往比較突出,這也是視頻路線能夠快速流行的重要原因。不過我們始終認為,僅有視頻并不足以滿足工業和游戲生產需求。如果希望兼容游戲引擎、物理仿真和工業流程,最終仍然需要可編輯、可修改、可導出的3D資產。因此從HY World 1.0開始,我們就堅持支持Mesh場景資產導出,希望讓模型真正進入生產系統,而不僅僅停留在演示階段。
HY World 2.0:多模態3D世界模型
2026年4月,我們正式發布并開源HY World 2.0。相比前代產品,HY World 2.0進一步增強了多模態能力。輸入側支持文本、單圖、多圖、視頻流以及幾何白模等多種形式。輸出側則支持圖片、視頻、3D Gaussian Splatting以及Mesh場景等多種結果形式。
![]()
整個系統由四個核心模塊組成:第一階段是HY-Pano,負責生成全景圖,為后續世界擴展提供空間先驗;第二階段是WorldNav,負責導航和路徑規劃。因為在一個世界中并非所有區域都可以通行,因此需要結合導航和路徑搜索能力實現合理漫游;第三階段是WorldStereo,負責世界擴展與新視角生成。它利用視頻模型生成高質量的新視角內容,同時引入空間一致性記憶機制,保證擴展區域與原場景保持一致;第四階段是WorldMirror,負責三維重建。我們希望打造一個統一的3D重建模型,支持多視圖、視頻流等多種輸入,并輸出點云、深度圖、相機參數以及3DGS等結果。
通過這四個模塊協同工作,HY World 2.0實現了從生成、導航、擴展到重建的完整閉環。
對世界模型未來的思考
過去一年多時間里,我們在世界模型方向投入了大量資源,也積累了一些經驗。在我們看來,目前世界模型仍然面臨幾個核心挑戰。
首先,行業還缺乏統一標準去定義“什么是好的World Model”。如果只是視覺質量高,其實遠遠不夠。真正重要的是,它是否能夠理解世界、模擬世界,并支持后續決策。
其次,物理可用性是世界模型的重要價值。目前很多模型能夠做到視覺正確,但距離物理正確仍有差距。視頻數據中包含大量視覺信息,但缺少精確的物理標注,因此模型在涉及復雜物理規律時仍然容易出錯。
第三,評測體系仍然不完善。對于世界模型而言,可交互性和物理準確性往往比視覺質量更重要,但目前行業尚未形成統一的評價標準。
![]()
最后,我們認為未來的發展方向一定不是單純擴大模型規模。世界模型的發展既依賴模型本身,也依賴高質量數據引擎。未來生成與重建將共同構成數據引擎,推動世界模型持續演進。同時,視頻世界模型和3D世界模型也會長期并行發展,并根據不同應用場景進行組合。
更重要的是,空間智能與語言智能最終不會割裂,而會不斷融合。我們希望未來能夠構建一個統一的多模態空間智能基礎模型。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.