![]()
![]()
如何把物理世界轉化為可訓練、可交互、可評測的數字世界?
作者|王博
近期,歐洲計算機視覺頂級會議ECCV 2026公布論文錄用結果,我們注意到一家中國公司的名字反復出現——群核科技。
這次群核科技共有三篇論文入選:Syn-GRPO討論了訓練數據如何在強化學習過程中持續生成和自我進化;SPEAR提出了一套面向具身智能研究的高保真仿真器,讓機器在進入真實世界之前,先在數字世界里觀察、行動、試錯和學習;WalkerBench則是分析了模型的空間智能如何在更接近真實世界的交互任務中被更合理評測。
這三篇論文,實際上反映了群核科技關于物理AI基礎設施建設的最新探索與思考:如何把物理世界轉化為可訓練、可交互、可評測的數字世界?
由此,群核科技的物理AI路線也變得更清晰。它并不僅是從數據服務商向“數據-仿真-評測”全鏈路延伸,更是在嘗試把自己過去多年積累的數據和空間智能能力,轉化為物理AI時代的底層基礎設施。
這套基礎設施的底座是群核科技沉淀的海量三維可交互數據,以及將物理世界數字化的能力;核心是結構化三維數據集和真實世界驅動的世界模型;面向的應用,則是具身智能、大模型、XR、工業孿生等需要空間理解和空間訓練的物理AI場景。
當空間理解、仿真訓練和持續學習能力成為物理AI新基建的要求,群核科技想扮演的角色,是連接物理世界與數字世界的“架橋人”。
1.為什么“架橋”
機器人行業最常討論的問題是模型和本體。
一邊是具身智能模型公司向視覺語言行動模型推進,試圖讓機器人擁有更強的理解、規劃和泛化能力;另一邊是機器人本體公司在降本、量產、供應鏈和場景落地上快速迭代。
但在訓練一臺真正能進入物理世界的機器人時,一個更基礎的問題會提前出現:它在哪里學習?
就像人類學習需要書本、學校和考試一樣,機器人學習也需要自己的“教材、訓練場和考卷”:首先,它需要獲得足夠真實、足夠結構化的訓練數據;然后,它需要仿真環境進行低成本、高頻次、可控的試錯;最后,我們需要評測它是否真的理解了物理世界的空間。
這就是“架橋”的意義。
橋的一端是真實的物理世界。那里有家庭、商超、工廠、街道,有真實的空間結構、物體關系和長尾場景。
橋的另一端是虛擬的數字世界。真實空間需要被采集、重建、生成、標注和仿真,才能變成機器可以訓練、交互和評測的數字資產。
而橋的價值,不只是把真實世界搬進數字空間,更關鍵的是,讓模型在數字空間里訓練出來的能力,最終能夠回到真實世界。
這也被稱為Real2Sim2Real閉環。
群核科技此次入選ECCV的三篇論文,恰好落在這座橋的幾個關鍵位置。
Syn-GRPO回答的是“訓練數據怎么持續生成”。強化學習訓練多模態模型時,常見問題是數據質量下降、模型答案趨同、探索空間變窄。Syn-GRPO通過在線數據生成,讓訓練樣本在過程中持續變化,避免模型只是在有限題庫里“背題”。
SPEAR回答的是“訓練場怎么建”。它提出了一套面向具身智能研究的高保真仿真器,把虛幻引擎生態里的高質量虛擬世界,變成可編程、可觀測、可交互的訓練環境。論文中,SPEAR開放超過1.4萬個虛幻引擎原生接口,可以以56 FPS輸出1080P照片級畫面,并同步提供深度圖、法線、語義分割、材質ID等多種傳感器數據。
![]()
SPEAR論文,圖片來源:ECCV
SPEAR的全稱是Simulator for Photorealistic Embodied AI Research(面向真實感具身 AI 研究的仿真器)。它由群核科技、Adobe、英特爾、英偉達、ETH Zurich等公司或機構的研究者共同完成。
這篇論文的作者陣容本身就很有信號意義:German Ros是英偉達仿真生態系統開發總監,唐睿是群核科技首席科學家,Stefan Leutenegger是蘇黎世聯邦理工學院副教授,Kalyan Sunkavalli是Adobe Research首席科學家,Vladlen Koltun曾參與自動駕駛仿真基準CARLA的推出。
![]()
SPEAR論文作者,圖片來源:ECCV
WalkerBench回答的是“空間能力怎么被評測出來”。它不再讓模型只看一張圖判斷距離或方向,而是基于真實街景構建交互式評測任務,讓模型像真實路人一樣移動、觀察、記憶和導航。
三篇論文分別對應“數據-仿真-評測”三個環節。它們共同說明,物理AI的競爭焦點正在發生變化:行業不僅需要更強的模型和本體,也需要一整套Real2Sim2Real的基礎設施。
這套基礎設施就是群核科技想架的橋。
![]()
制圖:甲子光年
2.憑什么“架橋”
物理AI的規模化落地,正面臨一個根本性的供給瓶頸:三維空間數據的規模化供給能力,遠落后于模型訓練需求的增長速度。
群核科技的“架橋”底氣來自于其十五年來形成的數據基礎設施壁壘。
第一個壁壘是數據底座。
群核科技已經沉淀超過5億個3D場景和4.8億個3D模型,覆蓋家居、工業、藥店、商超、餐廳等不同空間類型。相比普通3D模型庫,這些數據的價值不僅僅是數量,更重要的是結構,這是其能夠布局合成數據的基礎。
每個場景都包含戶型布局、語義分區、材質屬性、物體層級等信息,這意味著AI訓練時拿到的是帶有物理含義的空間數據。
而這些數據的稀缺性被行業低估了。文本和圖像可以從互聯網上大規模獲取,但三維空間數據沒有同樣的“開源紅利”。
尤其是室內數據。自動駕駛可以靠采集車跑遍城市,但室內場景涉及戶型結構、家具擺放、材質光照、遮擋關系,每個家庭、每個商超、每個藥店都不一樣。室內數據的獲取難度和復雜性遠超室外場景,而這恰好是群核科技十五年來通過空間設計軟件酷家樂積累的寶貴資源。
目前,群核科技的平臺上每天都在產生新場景,數據也成為了持續增長的活數據。
第二個壁壘是物理世界數字化能力。
合成數據解決了規模和成本問題,但物理AI最終要回到真實世界,仿真與現實之間的Gap始終存在。只靠合成場景,機器人可能學會“看起來合理”的空間,卻未必能適應真實環境中的材質、光照、幾何細節和遮擋關系。
去年,群核科技發力3DGS重建,通過掃描拍攝實體環境,通過其空間智能平臺Aholo的算法實現1:1復刻,將真實空間高保真地數字化還原。3DGS數據保留了真實世界的幾何精度、材質細節和光照特性,為訓練場景補上了真實性來源。
值得注意的是,群核科技已與影石、禾賽等硬件廠商合作,打通彼此軟硬件能力,探索端到端、一站式空間重建解決方案。
![]()
由影翎全景無人機拍攝,經Aholo空間智能平臺重建的場景,圖片來源:群核科技
更關鍵的是,群核科技并不只是把真實空間“掃描進來”。 3DGS因為效果逼真、渲染速度極快,已成為三維重建領域的主流方向之一。但由于3D高斯不具備結構化信息,所以導致只能用來“看”,而不能用來“用”。
群核科技的獨特性在于其基于空間理解和結構化的能力,可將3DGS數據進一步轉化為可訓練、可驗證數據資產的路徑。去年,群核科技的兩項工作InteriorGS、SAGE-3D分別賦予3DGS補充語義、碰撞體、物理屬性等信息,并推出基于3DGS的VLN評測基準SAGE Bench,這些工作都在讓真實世界數據真正進入具身智能訓練流程。
第三個壁壘是數據泛化能力。
原始數據再多,也不可能覆蓋所有訓練需求。機器人需要面對的是大量長尾場景:不同光照、不同視角、不同布局、不同物體組合、不同任務難度。同一個廚房,可以有無數種擺放方式;同一家商超,也會因為貨架、動線、人流變化產生不同訓練需求。
這就需要數據泛化能力。
群核科技自研的空間生成模型SpatialGen,可以基于空間布局語義,生成多視圖、多模態的三維場景。它能夠理解空間語義,生成從未真實存在但在物理關系上合理的新場景。
依托群核科技海量室內3D場景數據與多視角擴散模型技術,SpatialGen生成的多視角圖像能確保同一物體在不同鏡頭下始終保持準確的空間屬性和物理關系。
![]()
SpatialGen的多視角一致性演示,圖片來源:群核科技
如果說3D場景和3D模型是原料,3DGS重建補充了真實世界的質感和精度,那么SpatialGen則讓這些原料具備了持續擴展的能力。它把存量數據變成可泛化、可復用、可訓練的仿真世界,也讓群核科技的數據資產從靜態庫存,變成一條可以持續運轉的生產線。
這三個壁壘連在一起,構成了群核科技物理AI數據飛輪的底層邏輯:先用海量結構化數據解決規模問題,再用真實世界重建縮小仿真與現實的距離,最后通過空間生成實現數據泛化。
而最新的論文成果可以看到,群核科技的技術路線正在向仿真、評測等環節進一步延伸。“怎么持續獲得三維數據、怎么構建逼真的虛擬考場、怎么定義訓練結果的好壞”這套基礎設施,就是直面行業當前最大的痛點。
這個物理AI數據飛輪需要一個平臺來承載。對群核科技來說,這個平臺就是其空間智能訓練平臺SpatialVerse。
這是一個面向物理AI空間訓練的數據仿真平臺:它既是“數據工廠”,可以持續生成高保真的物理空間數據,也是“訓練場”,讓機器人和智能體在虛擬世界中完成低成本試錯。
「甲子光年」了解到,群核科技SpatialVerse已與智元機器人、銀河通用、穹徹智能、智平方、松應科技、禾賽等國內物理AI企業達成合作。此外,海外幾家主要科技巨頭也與其有著密切的產業和學術合作。去年,Google的模型訓練論文中,就專門致謝了SpatialVerse提供的物理級真實3D場景數據。
這對機器人企業來說,價值很直接:更低成本獲得訓練場景,更快覆蓋長尾任務,更安全地進行試錯,更系統地發現模型和控制策略的問題。
而對群核科技來說,這意味著過去服務人類設計師的空間能力,開始轉化為服務機器訓練的基礎設施能力。
![]()
群核科技空間智能全景圖,圖片來源:群核科技
3.世界模型競爭,不只在生成
如果說物理AI數據飛輪解決問題是“機器人如何訓練”,世界模型解決的則是另一個問題“機器人如何理解這個世界”。
今年,世界模型成為物理AI領域的高頻詞。2026北京智源大會期間,智源研究院就為世界模型定義了四條清晰的路線:語言、像素、三維結構、視覺表征。
第一類是以語言為中心的世界模型,包括VLM、VLA,模型在文本空間中預測下一個詞,學到的是語言描述的世界,并不能理解背后的物理后果。
第二類是以像素為中心的世界模型,像Sora和Seedance等視頻生成類模型,在視覺空間中學習視頻或圖像,學到的是像素描述的世界。
第三類是以三維結構為中心的世界模型,李飛飛團隊的World Labs Marble模型和群核科技走的都是這一路線。
第四類是以視覺表征為中心的世界模型,比如楊立昆的JEPA系列模型,預測的是視覺表征的壓縮,但視覺嵌入演化不等于物理規律演化。
這幾條路線共同說明,世界模型正在從語言、像素和表征,逐步走向三維空間和物理世界。但對物理AI來說,只會生成一個畫面、重建一個空間,仍然不夠。
機器人真正要進入真實世界,需要理解空間結構、物體關系和物理約束。它要知道一個房間里哪些地方可以通行,物體之間是什么關系,某個動作可能帶來什么后果。
這也是群核科技世界模型路線的特點:真實世界驅動。以真實物理世界數字化為核心,采用“空間重建 + 場景生成”雙輪驅動模式搭建自研世界模型,這也是其最核心的差異化路徑。
「甲子光年」了解到,群核科技自主研發了百億級多模態空間智能大模型。這是業界首個專注于3D室內場景認知與生成的空間智能大模型。該模型基于其大規模、高質量的三維場景數據訓練而成,具備結構化理解和可視化生成兩大核心能力。
目前,該模型已開源兩大核心子模型:空間語言模型SpatialLM和空間生成模型SpatialGen。2025年3月,SpatialLM開源后,與DeepSeek-V3、Qwen2.5-Omni一起登上全球最大的開源社區HuggingFace全球趨勢榜前三。
![]()
圖片來源:Hugging Face
SpatialLM是一個空間語言模型,通過一段視頻輸入,就能準確認知和理解此視頻對應的空間點云數據,并對點云數據進行推理和場景描述,最終將提取的信息以自然語言的形式呈現。
在行業內,SpatialLM這種空間理解模型相對少見。
總的來看,SpatialGen負責“生成空間”,SpatialLM負責“理解空間”,再加上3DGS重建“還原真實空間”,這三類能力疊加在一起,構成了群核科技空間智能的底層能力。
這一方面可以反哺SpatialVerse的數據仿真生產線。空間理解模型可以幫助平臺更好地標注和組織數據;空間生成模型可以擴展更多訓練場景;真實世界重建能力可以補充高質量現實數據。
群核科技與激光雷達廠商禾賽科技的合作就是基于這一背景。禾賽XT及JT系列激光雷達提供毫米級3D空間建模能力,群核科技的SpatialLM完成物理屬性智能標注,雙方聯合推出機器人仿真訓練場景生成方案,讓真實世界的空間數據直接進入AI的訓練流程。
另一方面,群核科技也在通過Aholo空間智能平臺,以API、SDK等方式把模型能力向行業逐步開放這些底層能力。群核科技世界模型的價值不只在內部訓練飛輪里循環,也有機會成為行業開發者、機器人公司和空間智能應用的基礎設施。
4.布局空間智能基礎設施,做物理AI“架橋人”
從整體來看,群核科技在物理AI產業鏈的布局已經形成清晰的三層架構。
第一層是工具層,以酷家樂、Aholo為代表。它們負責從物理世界源源不斷地獲取原始數據——設計師在酷家樂上創作的每一個方案、Aholo重建的每一個真實空間,都在為AI提供來自真實世界的“原料”。
第二層是世界模型層,涵蓋空間生成(SpatialGen)和空間理解(SpatialLM)。這一層負責將原始數據加工和泛化——讓AI不僅能看到三維空間,還能理解和生成三維空間。
第三層是數據層,以SpatialVerse為核心。這一層把前兩層的成果整合為可訓練、可交互、可評測的數字世界,通過“數據-仿真-評測”飛輪持續迭代。
三層架構形成動態飛輪,互相增強:工具層產出更多真實世界數據,世界模型層將其加工泛化,數據層形成可規模化使用的訓練資產,再反哺工具層和模型層。每一層都在加速下一層的進化。
從產業視角看,這套架構讓群核科技的定位發生了一次根本性的變化。
群核科技不直接造機器人,但他們在物理世界和數字世界之間架設橋梁,讓所有需要空間數據和仿真能力的玩家都能通過這座橋梁,更高效地抵達目的地。
機器人只是第一個明顯場景。世界模型需要空間一致性,XR需要空間重建,工業孿生需要空間仿真——這些方向看起來分散,底層問題其實一致:如何讓機器理解和使用三維空間。
物理AI正在讓“空間”的服務對象發生變化:機器也開始需要空間。空間不再只是人的視覺內容,也成為AI訓練和行動的基礎載體。
當然,這條路還在早期。物理AI的商業化場景仍在驗證,通用機器人能力還沒有完全成熟,Sim2Real也仍然存在Gap。
但從產業趨勢看,群核科技站在了一個關鍵的位置,也在回應一個關鍵的問題:誰能把真實世界持續轉化為可訓練、可交互、可評測的數字世界,誰就可能成為物理AI基礎設施的核心供應商。
一座橋真正重要的時刻,不是建成的那一刻,而是兩端開始有人往來的時候。
物理AI也一樣。真實世界的數據被帶入數字空間,機器在其中學習、試錯、評測,再把能力帶回真實場景。這個往返過程越順暢,物理AI離產業化就越近。
群核科技要做的,正是這條往返路徑上的基礎工程。現在這座橋上不一定喧嘩,但它決定了后來者能走多遠。
(封面圖來源:AI生成)
![]()
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.