![]()
讓 AI 給你辦事,有時候就像點外賣:下單秒接,出餐迅速。但是到手一看,圖片和實物嚴重不符。
前幾天,知危讓某國產文生圖模型成一張 “ 水杯倒了 ” 的圖片。拿到的結果 “ AI 感 ” 十足:一個表面凹凸不平的矮腳杯以一個 “ 詭異 ” 的姿態懸浮于桌面,杯子僅杯底與桌面接觸,杯身卻有點 “ 似接觸非接觸 ”。杯中的水也以一種明顯不符合杯中液位高度的狀態匯成一注流出。
![]()
而這就是生成式 AI 的局限——它并不理解真實的物理因果,只是靠龐大的數據訓練依據 “ 概率 ” 生成可能正確的結果,“ 假裝懂物理 ”。
就像圖靈獎得主楊立昆 ( Yann LeCun ) 在此前采訪中提到的, “ 目前人工智能系統在很多方面還非常‘笨’,它們并不理解物理世界、也沒有長期記憶,無法真正地進行推理或規劃,而這些才是智能行為的關鍵特征。”
而如果希望 AI 能夠真正識別、理解并作用于真實的物理世界,自主完成感知、交互、決策和執行,真正從互聯網這個 “ 虛擬世界 ” 走向真實 “ 物理世界 ”,從生成式 AI 走向物理 AI,關鍵會是什么?
![]()
在楊立昆等科學家看來,首先可以排除的是純文本訓練。
楊立昆以嬰兒認識物理世界過程為例,提到嬰兒從剛剛出生到九個月的時候,并不具備重力、慣性等 “ 物理直覺 ”。但是到九個月的時候,將一個放在平臺上的小車推下去,小車如果懸浮在空中,九個月大的嬰兒就會張大眼睛持續盯著看,表現出非常驚訝的樣子。
![]()
這期間,嬰兒并不是因為通讀了《 物理學入門 》或者是被輸入了大量文本作出的反應,而是通過感知和互動開始學習世界。進而,楊立昆提出真正的智能體需要一個 “ 世界模型 ”,一個能讓你通過觀察與互動來學習,在‘腦里’里模擬事情、預測后果、想象未發生的事情的東西。
無獨有偶。斯坦福大學知名教授、“ AI 教母 ” 李飛飛也提到,真正的通用智能 ( AGI ) 無法僅靠語言模型實現,必須引入對物理世界的理解維度。“ 語言賦予了機器一種談論世界的方式。世界模型,是機器最終得以理解、想象、推理并與世界互動的方式。”
不難看出,如果將 “ 打造識別、理解、作用于現實世界的物理 AI ” 比喻成 “ 建蓋一座摩天大樓 ”,那么摩天大樓的地基大概率就是 “ 世界模型 ”。如同大語言模型是生成 AI 時代的基座,因為它壓縮了人類文明的文本知識;那么世界模型是物理 AI 時代的基座模型,因為它壓縮了物理世界的運行規律。
![]()
事實上,自 2023 年 OpenAI Sora 的發布引爆世界模型概念以來,該賽道發展就不斷加速。從國內來看,據商業數據服務商 IT 桔子 6 月 18 日最新報告,中國共有 33 家世界模型創業公司,85% 在 2023 年后成立,累計融資超 260 億。海外巨頭谷歌、英偉達、特斯拉等紛紛入局,World Labs、Meta JEPA 等團隊也正持續加碼。
然而,理想雖豐滿,現實卻很骨感,做世界模型并不是一件容易堅持下去的事,比如引爆世界模型概念的 Sora 已經被 OpenAI 宣布全線停運了。
![]()
停運的理由也很簡單:OpenAI 暫時玩不轉這件事兒。
他們沒有足夠的精力、沒有足夠多的場景,以及,他們沒有足夠的錢了。Anthropic 帶著 Coding 能力極強的 Claude 大殺四方,給包括 OpenAI 在內的所有 AI 公司都帶來了巨大的壓力:你必須去卷 Coding,Coding 就是一切,Coding 就是未來。
所以或許,無論 OpneAI 也好、Anthropic 也好、Meta 也好,有沒有那么一種可能:世界模型的突破不會在他們身上發生?
他們是生成式 AI 的簇擁者,他們的技術路線、盈利模式、商業規劃,一直都是順著生成式 AI 這條路來的,他們并沒有世界模型的原生思想。
現在,行業總是講 AI-Native( AI 原生 )才會贏得未來,如果贊同這個邏輯,那么在世界模型這條路上,一定是 “ 世界模型原生 ” 也就是 “ 從一開始就準備拿 AI 與物理世界做交互 ” 的公司更容易贏得未來。
昨日 ( 6 月 23 日 ) 剛剛正式通過港交所上市聆訊的 Momenta,可能就是其中之一。它在市場上有另一個外號,叫“ 物理 AI 第一股 ”。
此前,其在 4 月發布了物理 AI 基座模型——Momenta R7 世界模型。
就像我們前面所提到,嬰兒擁有 “ 物理直覺 ” 的關鍵是對外界的感知和互動。所以,Momenta R7 搭建了一個讓 AI 增加 “ 物理直覺 ” 的三層架構,讓 AI 形成對物理世界的認知,擁有因果推演的能力。
![]()
第一層是世界模型預訓練 ( World Model Pre-Training ),目標是讓模型更懂物理。物理在交通運輸領域的重要性不言而喻,相信在路上跑了數十年沒出過事故的老司機,依靠的不是死記硬背駕校教的行車口訣,而是實實在在的生活實踐經驗,比如下雨天提前剎停,遠離滿載貨車等等。
Momenta 把海量真實駕駛數據的預訓練,把物理規律、常識和因果關系壓縮進模型,讓系統對物理世界有了基礎的認知。這背后,是搭載 Momenta 系統的 90 多萬臺 L2++量產車,累計超過 120 億公里的真實行駛里程,以及其中提煉出 1 億段黃金數據,這是大多數同行都難以契機的數據規模。
第二層是世界模型仿真 ( World Model Simulation ),這相當于給模型提供了一個 "練兵場"。 現實生活中有個很常見的現象:很多人在大學期間利用寒暑假考取了駕照,卻一連多年不敢真正上路。原因很簡單——駕校的路況與真實世界天差地別,現實道路上充滿了各種突發狀況和極端場景。
而 R7 世界模型卻為自動駕駛汽車提供了一個接近現實的練車環境:系統利用生成模型推演周圍環境,進行閉環仿真,從而預判自身行為變化將引發世界如何演變。同時,系統還能對極端罕見的長尾場景進行評估與驗證,效率比傳統實車路測高出數個數量級。由于這個仿真世界本身是從真實數據中學習構建的,Momenta 可以將實車數據與仿真結果進行交叉校驗,清晰掌握仿真與真實世界之間的差距有多大、具體差在哪里,為 AI 打造一個真實可靠的 “ 練兵場 ”。
第三層是在世界模型中進行強化學習 ( World Model Reinforcement Learning ),扮演 "教練" 的角色。 普通人學開車,僅靠駕校教練的口頭講解和示范是遠遠不夠的——關鍵是教練坐在副駕駛,對學員的每一次操作及時給予肯定或糾正,學員才能越開越好。
R7 世界模型第三層架構的工作邏輯也是如此:通過獎懲機制讓大模型反復探索與試錯,最終輸出比人類預先提供的經驗更安全、更高效、更絲滑的駕駛表現。
通過三層架構,從 “ 懂 ” 到 “ 實踐 ” 再到 “ 精進 ”,Momenta R7 將自動駕駛汽車逐步變成一個能理解物理世界規律、擁有因果推斷能力、自主做出決策的智能體。
![]()
有好的技術架構,只是第一步,就像生成式 AI 一樣,物理世界的 AI 也需要數據。
以 Momenta 為例,它不僅 “ 有 ” 海量數據,更關鍵是它已經跑通 “ 數據驅動模型進化 ” 的閉環。
在物理 AI 領域,數據不是靜態的資產,而是越轉越快的引擎。90 多萬臺 L2++量產車每天在路上跑,意味著 Momenta 的系統正在持續接觸真實世界的長尾場景:暴雨中的模糊車道線、施工路段的臨時改道、夜間對向車輛的眩光干擾……這些 Corner Case 被源源不斷地回傳、標注、訓練,再反哺給下一代模型。競爭對手即便砸下重金采集數據,也難以在同等時間跨度內積累起如此規模的 “ 活數據池 ”。
![]()
世界模型數據處理過程的簡單示意|圖源Nvidia
更為關鍵的是,Momenta 的數據優勢并非停留在 "量" 的層面。通過與 24 家車企、全球前十大車企中的 9 家建立合作,其數據覆蓋了中國乃至全球多樣化的道路環境、駕駛習慣和法規場景。這種跨地域、跨車型、跨用戶群體的數據廣度,使其模型在面對不同市場的本地化適配時,天然具備更強的泛化能力。
做物理 AI 研發是需要門票的。而 Momenta 擁有充裕的彈藥儲備:截至 2025 年底,公司現金儲備超 100 億元,為其加速物理 AI 發展提供了有力支撐。
此外,Momenta 近三年營收從 7.43 億元躍升至 24.13 億元,三年翻 3 倍,年均復合增長率超 80%,但這組數字的真正含金量藏在收入結構里。其營收由技術開發收入與許可收入兩部分構成,其中許可收入增速表現尤為亮眼,從 2023 年的 0.23 億元大幅增長至 2025 年的 9.68 億元,三年翻 42 倍。技術開發收入確保當下有穩健現金流和車企生態位,許可收入的爆發則證明 Momenta 已跨越物理 AI 企業的 "純投入期",進入 "數據驅動產品化、產品化驅動規模化變現" 的正向循環。
![]()
在 Momenta CEO 曹旭東看來,物理 AI 的核心是數據 Scaling+商業 Scaling,且二者形成正反饋。而很顯然,Momenta 目前已在行業中率先跑通這兩個 Scaling。
值得一提的是,業內普遍將世界模型當作 "仿真考場"——生成虛擬數據,用來給主模型做模擬測驗、查漏補缺。世界模型是備考工具,主模型才是上考場的考生。而 Momenta 是市場上為數不多將世界模型直接注入 "端到端基座模型預訓練" 的玩家,世界模型成為了主模型的一部分。
如果說前者是考前狂刷模擬卷,那 Momenta 則是直接重構了學生大腦里的認知結構——把物理規律、因果關系和常識判斷,在預訓練階段就壓縮進模型的底層架構。這讓世界模型成為了一個超級 “ 放大器 ”,使系統的整體產品性能和上限實現了 10 到 100 倍的代際躍升。
曹旭東的判斷是,智駕行業具有極強的規模效應和先發優勢——數據越多、場景越豐富,系統迭代越快,馬太效應顯著。基于此,他預計全球市場最終僅有 3-4 家核心供應商能夠勝出。
而今,Momenta 已將戰略視野從乘用車拓展至更廣闊的物理 AI 版圖。
在 Momenta 看來,掌握底層物理規律的世界模型,具備強大的跨場景泛化能力。它不需要為每種載具單獨 "補課"——只要真正理解了慣性、運動因果等通用物理法則,同一套底層架構就能同時賦能四大業務形態:乘用車、Robotaxi、Robovan 與 Robotruck。未來,這套認知體系還可能進一步延展至具身智能等更廣闊的物理交互領域。
Momenta 正憑借著先發優勢和規模優勢,摩拳擦掌力爭在這場物理 AI 的卡位戰中占據一席之地。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.