![]()
??深響原創(chuàng) · 作者|何理
AI的風(fēng)向,已經(jīng)變了。
此前,無論大語言模型還是Agent、龍蝦,AI始終在“屏幕內(nèi)”,「數(shù)字AI」不斷探索邊界,也卷成了紅海。而現(xiàn)在,在屏幕之外,一個更龐大、更具想象力的AI新戰(zhàn)場正在形成——行業(yè)目光集體轉(zhuǎn)向能真正在真實世界里動手干活兒的「物理AI」。
巨頭對此紛紛下注:英偉達高調(diào)推出全模態(tài)物理AI模型NVIDIA Cosmos 3,還亮出了機器人領(lǐng)域的全家桶,黃仁勛反復(fù)強調(diào)物理AI將成為下一波浪潮,世界模型是實現(xiàn)物理人工智能的核心;馬斯克也在將AI的觸角延伸至物理世界,F(xiàn)SD(完全自動駕駛)實現(xiàn)端到端進化,Optimus人形機器人高頻迭代……
有意思的是,在物理AI的藍圖里,率先承接機會的并非是尚在實驗室里練習(xí)行走的雙足人形機器人,而是已經(jīng)在公路上比比皆是的智能汽車。自動駕駛是目前非常稀缺的能夠同時跑通“海量物理數(shù)據(jù)閉環(huán)”與“高頻商業(yè)造血”的通用物理AI場景。而世界模型則是物理AI的底座,是激發(fā)物理AI“GPT時刻”的關(guān)鍵突破口。
6月23日,物理AI公司Momenta通過港交所聆訊,正式進入IPO沖刺階段,即將領(lǐng)銜“物理AI第一股”。在智駕的基礎(chǔ)上,Momenta正在打造一個能夠理解物理規(guī)律、推演世界演變的通用世界模型,成為物理AI基座模型的構(gòu)建者。
目前,Momenta R7世界模型已實現(xiàn)量產(chǎn)首發(fā),意味著物理AI正式從技術(shù)理念走向規(guī)模化量產(chǎn)落地,實現(xiàn)從“看見世界”到“理解世界”的跨越。與此同時,在競爭最為激烈的中國第三方城市NOA供應(yīng)商市場中,Momenta以高達65%的市占率行業(yè)居首,Momenta的客戶已覆蓋國內(nèi)全部主流乘用車企業(yè),且全球前10大車企中已有9家與其開展合作,成為“全球品牌的共同選擇”,這也驗證了自動駕駛作為物理AI的核心賽道的規(guī)模化商業(yè)價值。
此外,Momenta的股東陣容極其豪華,匯聚了全球最核心的產(chǎn)業(yè)和科技戰(zhàn)略投資人,以及全球頂級財務(wù)投資人。產(chǎn)業(yè)資本囊括了全球汽車產(chǎn)業(yè)鏈的核心玩家,包括:上汽、通用、奔馳、豐田、比亞迪、現(xiàn)代、奇瑞等7家全球頂級車企,以及博世、德賽西威、立訊精密等頭部產(chǎn)業(yè)鏈合作伙伴,和Uber、Grab、Stone Venture等Robo合作伙伴。科技巨頭則包括騰訊、阿里云、螞蟻集團、京東等。財務(wù)投資人更是覆蓋了淡馬錫、IDG、阿曼投資局、亦莊國投、Granite Asia、順為、蔚來資本、凱輝基金、云鋒基金、藍湖資本、創(chuàng)新工場、真格基金、鼎暉投資、高榕創(chuàng)投、高成資本、眾為資本、愉悅資本、鐘鼎資本、盈峰資本、招銀國際、華泰創(chuàng)新資本、混沌資本、春華資本、大灣區(qū)基金、國新基金、光合創(chuàng)投、九合創(chuàng)投、錦秋基金等全球最頂尖投資機構(gòu)。超豪華、多元化的股東陣營,不僅為Momenta提供了戰(zhàn)略和資本支持,還從業(yè)務(wù)協(xié)同、用戶增長和全球化布局等方面助力了Momenta高速增長。
世界模型帶來新的“GPT時刻”
說起“物理AI”其實不難理解,簡單來說,它就是將人工智能的感知、決策與學(xué)習(xí)能力,深度嵌入機器人、智能設(shè)備、自動化產(chǎn)線等物理實體系統(tǒng)中,使其能夠在復(fù)雜、動態(tài)的真實物理環(huán)境中自主執(zhí)行任務(wù)。如果說過去AI突破主要體現(xiàn)在數(shù)字世界,那么物理AI的興起,則意味著AI發(fā)展進入了以理解和影響物理世界為核心的新階段。
但不同于數(shù)字AI,物理AI并不是一條單線賽道。具身智能、自動駕駛、工業(yè)機器人、邊緣AI,都在把AI從屏幕帶進現(xiàn)實世界,它們之間也并非對立關(guān)系,更像是物理AI走向現(xiàn)實的不同入口。而世界模型(World Model),正是這一切的共同底座——它是AI理解物理世界、預(yù)判未來并自主決策的“內(nèi)在思維系統(tǒng)”。
要理解世界模型的關(guān)鍵性,我們不妨將其與大語言模型(LLM)做個對比:
大語言模型擅長的是“讀萬卷書”,它理解語義、擅長推理,在虛擬符號世界里無所不知,但它并不真正掌握物理規(guī)律,無法本能地理解“推倒杯子水就會灑”;世界模型則擅長“行萬里路”,它能夠深刻理解物理世界的規(guī)則,預(yù)測動作帶來的后果,并支持AI在現(xiàn)實世界中做出實際行動。
純語言模型或傳統(tǒng)簡單算法的短板很明顯:它們要么不懂物理規(guī)律,無法應(yīng)對瞬息萬變的動態(tài)場景;要么必須在真實環(huán)境中通過海量的肉身試錯來“刷經(jīng)驗”,比如機器人不斷摔倒,這不僅導(dǎo)致硬件損耗成本高昂,更伴隨著不可承受的安全風(fēng)險。
現(xiàn)實世界場景多變且充滿不確定性,人類無法用死板的規(guī)則預(yù)設(shè)所有的突發(fā)情況。因此AI必須具備自主理解和預(yù)判能力,才能適應(yīng)不同環(huán)境。而世界模型正是要解決這一痛點——在AI的大腦中搭建了一個“虛擬練兵場”,先通過預(yù)訓(xùn)練賦予模型理解現(xiàn)實世界的“物理直覺”,讓AI真正“懂物理”;再利用這套規(guī)律在虛擬練兵場里“腦補”行動后果,配合強化學(xué)習(xí)的獎懲機制,讓大模型在無風(fēng)險、低成本的環(huán)境中反復(fù)探索、試錯并給出最優(yōu)決策。這種從理解物理規(guī)律到在虛擬試錯中進化出最優(yōu)行動方案的閉環(huán)能力,正是世界模型能夠打破虛擬與現(xiàn)實鴻溝,成為具身智能和通用人工智能核心基石的關(guān)鍵原因。
![]()
今年世界模型熱度明顯升溫,很多不同的技術(shù)路線、不同的場景模型都冠以世界模型:
有的以語言為中心,比如VLM、VLA是把其它模態(tài)、其它能力映射到語言空間。
有的以像素為中心,比如Sora,實際上是在預(yù)測下一個2D像素場景,由于其訓(xùn)練數(shù)據(jù)大量來自影視作品,模型極易生成不符合真實物理規(guī)律的內(nèi)容,比如像星戰(zhàn)“原力”一樣違背重力邏輯的畫面。圖靈獎得主Yann LeCun也曾多次公開批評,生成像素并不等同于理解物理因果;
還有的以三維結(jié)構(gòu)為中心,比如李飛飛World Labs的"空間智能"理念,從單張圖片生成可交互的持久化3D環(huán)境,本質(zhì)上瞄準(zhǔn)的是數(shù)字世界的構(gòu)建。但模型重建3D空間不等于理解世界,幾何結(jié)構(gòu)也不代表復(fù)雜的物理動態(tài)演變狀態(tài)。
由此可見,當(dāng)前各個方向的世界模型的痛點核心,在于對物理規(guī)律的理解深度,以及能否最終服務(wù)于“行動”。我們開發(fā)世界模型,不是為了教模型去生成一段好看的視頻,而是要教它理解物理規(guī)律,并基于這種理解去精準(zhǔn)預(yù)測下一個狀態(tài)。行業(yè)真正需要的,是把多模態(tài)感知、物理規(guī)律理解和動作執(zhí)行三者徹底打通。
Momenta R7世界模型如何構(gòu)筑物理AI底座?
而要實現(xiàn)多模態(tài)感知、物理規(guī)律理解和動作執(zhí)行三者打通,就必須擁有海量的真實物理交互數(shù)據(jù)與場景,率先跑通數(shù)據(jù)和商業(yè)規(guī)模化閉環(huán),讓“數(shù)據(jù)回流再推動模型能力躍升”的正向循環(huán)真正轉(zhuǎn)起來。在這個前提下,擁有斷層式數(shù)據(jù)紅利的自動駕駛賽道,自然成為了最先解出這道題的產(chǎn)業(yè)先鋒。
無論是Mobileye、Waymo,還是Momenta,這些自動駕駛的頭部公司都不約而同地成為了物理AI的排頭兵,自動駕駛公司積累的能力,正在被重新理解為可以泛化到更廣義物理AI的平臺能力。
Momenta在數(shù)據(jù)、場景、世界模型架構(gòu)方面的優(yōu)勢格外顯著:
在數(shù)據(jù)規(guī)模方面,Momenta擁有基于120+億公里實車?yán)锍烫釤挼?億段黃金數(shù)據(jù),還有真實世界里大量數(shù)據(jù)的反饋,覆蓋更多長尾場景。Momenta以真實數(shù)據(jù)學(xué)習(xí)生成世界,它可以通過實車和仿真的一致性來做對齊和校準(zhǔn),并擁有明確可參考的基準(zhǔn),這種“真生成”最大程度地減少了仿真與現(xiàn)實之間的差異,比生硬的渲染方式要可靠得多。
而在世界模型方面,Momenta R7的三層架構(gòu)更是獨樹一幟。
第一層World Model Pre-Training(世界模型預(yù)訓(xùn)練), 讓模型懂物理。傳統(tǒng)的智駕大模型大多是在“背題庫”,而R7則是在“學(xué)規(guī)律”。它通過海量真實駕駛視頻的預(yù)測訓(xùn)練,將物理規(guī)律、常識與因果關(guān)系壓縮進模型,讓系統(tǒng)形成對物理世界最底層的基礎(chǔ)認知,不再機械地依賴人工規(guī)則。
有了物理常識,模型需要演練,第二層World Model Simulation(世界模型仿真),就是讓模型擁有“練兵場”。R7利用生成式模型推演周圍環(huán)境進行閉環(huán)仿真,讓系統(tǒng)能夠推演自身行為變化時世界將如何演變。依托這種高效場景推演能力,AI可以對現(xiàn)實中很罕見、很危險的長尾場景進行性能評估,其效率比傳統(tǒng)實車路測提升了上萬倍。
第三層則是World Model Reinforcement Learning(在世界模型中進行強化學(xué)習(xí)),系統(tǒng)通過精心設(shè)計的獎懲機制讓大模型反復(fù)探索與試錯。它在虛擬世界里經(jīng)歷千萬次的博弈推演,自主學(xué)會了在復(fù)雜多變的動態(tài)環(huán)境里如何做出最優(yōu)決策,最終輸出更安全安心、高效絲滑的類人駕駛表現(xiàn)。
這套架構(gòu)可以說是物理AI現(xiàn)實價值的直觀體現(xiàn)。比如開車的時候,前方意外掉落一箱蘋果,Momenta就可以自主預(yù)判蘋果滾落的軌跡與擴散范圍,提前平穩(wěn)減速、規(guī)劃繞行路線,以更從容、更貼合人類駕駛邏輯的方式處理突發(fā)路況。
Momenta R7理解的是物理世界的運動規(guī)律與交互邏輯,而非依賴場景記憶與規(guī)則匹配。真正的物理AI,不只是讓車輛在絕大多數(shù)日常場景中順暢行駛,更要在萬中無一的罕見極端場景中,依然為用戶提供更穩(wěn)健的安全保障。
![]()
從整體視角來看,Momenta R7世界模型這三層架構(gòu)并不是孤立的三個模塊,而是一個有機統(tǒng)一、高頻自運轉(zhuǎn)的整體:一方面認知一體,從第一層的“理解物理”,到第二層的“推演未來”,再到第三層的“動作決策”,R7架構(gòu)打破了過去感知、預(yù)測、規(guī)劃各自為戰(zhàn)的割裂狀態(tài),信息在同一套基座模型中流動;另一方面可以自進化,第一層提供認知,第二層提供空間,第三層在空間里刷經(jīng)驗,三者互為因果,數(shù)據(jù)在內(nèi)部滾動即可實現(xiàn)模型的自我升級。
目前行業(yè)內(nèi)普遍僅將世界模型用作“生成數(shù)據(jù)”的仿真工具,好比考前多刷一些模擬題,Momenta是市場上極少數(shù)直接將世界模型用于“端到端基座模型預(yù)訓(xùn)練”的公司。這種底層的應(yīng)用代差,讓系統(tǒng)整體的產(chǎn)品性能和進化上真正與其他人拉開距離。
另外,招股書顯示,2025全年Momenta研發(fā)投入為18.69億元,占其年度收入的77.5%,近三年累計研發(fā)投入達46.6億元。截至2025年底,公司擁有研發(fā)人員1157名,研發(fā)人員占比近82%,超過三分之二擁有碩士及以上學(xué)歷。堅決的研發(fā)投入會進一步鞏固和加強Momenta的技術(shù)領(lǐng)導(dǎo)地位。
技術(shù)跨場景落地,指數(shù)級優(yōu)勢顯現(xiàn)
而更重要的是,技術(shù)的積累正在落地于應(yīng)用。Momenta R7世界模型已經(jīng)走出了實驗室,在真實的產(chǎn)業(yè)與資本浪潮中率先跑通了數(shù)據(jù)+商業(yè)的兩大閉環(huán)。
一方面是實打?qū)嵉牧慨a(chǎn),Momenta R7 世界模型已量產(chǎn)首發(fā),目前搭載Momenta系統(tǒng)的量產(chǎn)車輛規(guī)模已超90萬臺,已成功交付超100款量產(chǎn)車型,累計定點車型數(shù)超210款,并實現(xiàn)最快不到40天交付10萬臺的高效部署。復(fù)雜路況下產(chǎn)生的海量交互數(shù)據(jù),實時、高頻地流回模型,會進一步促使 R7 實現(xiàn)指數(shù)級自我進化。
另一方面則是實打?qū)嵉臓I收,招股書顯示,Momenta近三年營收規(guī)模實現(xiàn)跨越式增長:2023年至2025年,Momenta營業(yè)收入從7.43億元增長至24.13億元,三年翻三倍,年均復(fù)合增長率超80%。截至2025年底,公司現(xiàn)金儲備超100億元,為加速Robo市場和全球化發(fā)展提供了有力支撐,有利于其在物理AI的長期戰(zhàn)役里占據(jù)主動權(quán)。
![]()
圖源:招股書
由此Momenta得以形成飛輪效應(yīng),“平臺級”的架構(gòu)將終結(jié)過往各場景孤立開發(fā)、重復(fù)造輪子的傳統(tǒng)模式。其用一套大模型同時覆蓋乘用車以及無人駕駛出租車(Robotaxi)、無人物流車(Robovan),2027年還將擴展至無人駕駛卡車(Robotruck)領(lǐng)域。
核心底層技術(shù)的跨場景復(fù)用,極大地攤銷了多業(yè)務(wù)線并行的研發(fā)成本,使得邊際成本大幅降低。可以想象,未來這種從智駕中錘煉出來的、打通了“感知-物理常識-行動”的底座能力,還可以無縫延展到具身智能、工業(yè)機器人等更廣闊的通用物理 AI 領(lǐng)域。
![]()
Momenta的“兩條腿”策略
目前,智駕領(lǐng)域正呈現(xiàn)出一種“摩爾定律”式的進步節(jié)奏,在端到端與世界模型的加持下,行業(yè)部分頭部企業(yè)開始展現(xiàn)出遠超以往的能力迭代速度。
而Momenta的規(guī)模效應(yīng)和先發(fā)優(yōu)勢也在多個維度展開:體驗上,數(shù)據(jù)越多,算法越聰明,體驗越好;交付上,建立工程化壁壘后迭代極快,Momenta 交付首個 10 萬臺車用了整整 2 年,而如今僅需要不到 40 天即可完成 10 萬臺車的交付;客戶上,頭部車企的信任也在不斷積累,在 Momenta 的客戶群體中,既有BBA德系豪華,也有通用、大眾、豐田、日產(chǎn)、本田等 20 余家全球主流車企,擁有不同背景的中德美日韓頂流品牌,這些合作案例也成為 Momenta 量產(chǎn)能力和市場接受度的最直觀證明。
![]()
回頭看AI的發(fā)展路徑,會發(fā)現(xiàn)一個有趣的規(guī)律:每一次技術(shù)范式切換,資本市場最終定價的都不是某個單點產(chǎn)品,而是能夠定義下一代基礎(chǔ)設(shè)施的平臺能力。
大語言模型時代,市場重估的是能夠理解和生成信息的數(shù)字智能;而當(dāng)AI開始走出屏幕、進入真實世界,市場重新尋找的則是能夠理解物理規(guī)律、預(yù)測世界演化并驅(qū)動行動決策的物理智能。從這個角度來看,Momenta上市的意義,不僅是自動駕駛業(yè)務(wù)的資本化,更是世界模型、物理AI第一次進入公開市場的價值驗證。
行業(yè)普遍判斷,智駕及物理 AI 底座最終將是“馬太效應(yīng)”的局面,未來全球市場最終可能只會留下少數(shù)頭部玩家。而Momenta勢必能以自身的稀缺性、技術(shù)領(lǐng)先、商業(yè)閉環(huán)迎來“贏者通吃”的應(yīng)許之期。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.