編輯|陳陳
世界模型正在成為具身智能最擁擠的技術路口。
有人把它當作機器人數據生成器,通過視頻模型批量制造訓練素材;有人把它做成高保真仿真環境,用于訓練和評估機器人策略;還有一些團隊正繼續向前,嘗試把世界理解、未來預測與動作控制放進同一套模型,讓機器人在內部推演之后直接行動。
不同路線在今年 WAIC 迎來一次正面交鋒。
7 月 19 日,WAIC 2026 世界模型六小龍巔峰論壇在上海舉行。大曉機器人、螞蟻靈波、極佳視界、無界動力、智元機器人、自變量機器人同臺出現,共同探討「驅動物理 AI 從理解到執行」這一議題:世界模型正驅動物理 AI 實現從理解向執行的躍遷,完成從因果推演到實體控制的閉環,攜手共啟物理 AI 的開悟時刻。
![]()
作為論壇承辦方,大曉機器人(ACE ROBOTICS)算得上是六家企業中發展速度較快的一家,被業界稱為「卷王」。
公司成立后不久便提出「以人為中心」的 ACE 具身智能研發范式,形成「環境式數據采集 — 開悟世界模型 — 具身交互」的全鏈路技術體系。
在模型層,開悟世界模型 3.0(Kairos)在四大全球權威具身智能基準上全面登頂,新發布的開悟世界模型 3.1 進一步融合生成智能、物理智能與認知智能,構建起了理解 — 推演 — 執行 — 反思的全鏈路自進化閉環。
落地上,搭載 A1 模組的機器狗已經進入園區巡檢、城市治理等場景;全新履約機器人 W1,可以完成商品揀選、裝箱和搬運,已落地 Sense MartGo 燒賣購、快客達等客戶場景。
技術和產品推進之外,大曉機器人在資本市場也保持了較快節奏。今年 2 月,公司完成由螞蟻集團領投的天使輪融資;4 個月后,又完成天使 + 輪融資。至此,大曉機器人在 2026 年上半年累計融資達數億美元。
WAIC 2026 現場,大曉機器人董事長王曉剛宣布三大核心成果發布:開悟世界模型 3.1(Kairos 3.1)、環境式數據采集方案 2.0,以及覆蓋三大垂直場景的成套解決方案。
![]()
具身世界模型第一性原理,機器人真正需要理解什么
在數字世界里,模型預測錯誤,可能只會生成一個不合理的詞,但在物理世界中,當具身模型出現理解偏差或預測錯誤,結果會直接轉化為錯誤行動,帶來真實且可能無法逆轉的代價。
如何降低這種代價?
基于這一問題,王曉剛首次系統闡釋了大曉對具身世界模型第一性原理的理解。
![]()
世界模型需要從冗余的多模態輸入中,提取與任務和控制最相關的高密度信息,建立能夠支持機器人行動的控制充分狀態,并在充滿不確定性的環境中,盡可能降低智能體的行動代價。
所謂控制充分狀態,指的是機器人完成當前任務所必需的關鍵環境信息。機器人掌握的關鍵信息越充分,對控制狀態的理解越準確,執行過程中犯錯的概率就越低,相應的行動代價也會下降。
這一判斷,也構成了大曉世界模型技術路線的理論起點。
當前,全球具身世界模型大致沿著幾類路線發展。
表征式世界模型擅長從視覺和傳感器輸入中提取抽象特征,幫助機器人識別物體、場景與空間關系;生成式世界模型更關注未來畫面和環境狀態的生成,可以模擬動作發生后,世界可能呈現出的變化;交互式世界模型則強調智能體與三維環境之間的持續反饋,使模型能夠在交互過程中調整策略。
這些路線分別解決了世界理解、狀態推演和環境交互中的一部分問題。
面向真實機器人作業,單一能力很難獨立支撐完整閉環。機器人需要理解當前環境,推演不同動作可能帶來的結果,還需要將推演結論轉化為可執行的動作,并在執行后判斷任務是否符合預期。
行業由此開始走向行動一體化世界模型,將理解、生成和動作預測放入統一架構,使模型能夠從生成未來畫面進一步走向預判行動對世界造成的真實影響。
![]()
開悟世界模型 Kairos 3.1,理解 - 生成 - 預測一體化世界模型
大曉機器人發布的Kairos 3.1,正是沿著這一路線展開的系統化探索,其融合了生成智能、物理智能和認知智能。
![]()
生成智能用于建立物理世界的內部表征,使模型能夠刻畫當前環境,并生成未來可能出現的狀態。物理智能負責理解動作與結果之間的因果關系,在平行空間中推演不同動作路徑。認知智能則負責處理復雜指令,完成長程任務理解、步驟拆解和策略規劃。
開悟世界模型 3.1 通過原生統一架構融合世界理解、內容生成和動作預測三項能力,并在此基礎上構建可持續自進化的智能閉環。
依托混合 Transformer 架構和混合共享注意力機制,多源信息被壓縮至統一的隱空間,形成高密度特征表征,從而打通理解、生成和預測。
![]()
開悟世界模型端側控制本體演示:https://mp.weixin.qq.com/s/aSd-F7nPG26N74nmRlMsbw
從理解世界,到推演行動
開悟世界模型 3.1 的核心能力,可以概括為理解、生成和預測。
首先是理解。ACE-BRAIN-0.5 作為 Kairos 3.1 的空間理解核心底座,為系統提供感知與認知根基。
截至目前,ACE-BRAIN-0.5 已累計斬獲十二項全球基準測試 SOTA,單一模型實現全維度能力躋身全球第一梯隊。
![]()
物理生成層面,Kairos 3.1 構建了高保真、可交互的數字平行世界,為機器人的腦海推演提供了真實可信的仿真底座。其數據基礎設施包含約 30 萬套中國住宅平面圖、5000 個全屋仿真場景和 8700 個高質量 3D 資產。每個物體均具備幾何、尺度、材料、力學和功能等物理屬性,為機器人提供大規模訓練和測試環境。
![]()
最后是預測。機器人在真實行動之前,可以在模型內部生成多條候選軌跡,推演不同動作可能帶來的結果。
這種能力讓機器人不再依賴單次嘗試。面對復雜任務,它可以先推演行動后果,再執行經過篩選的策略,從而提高成功率,降低真實世界中的試錯成本。
世界模型開始進入機器人端側大腦
要讓世界模型真正驅動機器人,還要解決推理速度和部署成本。
如果機器人每完成一次環境理解和動作預測,都需要把數據上傳到云端等待返回,通信延遲和網絡波動就可能影響連續作業。
Kairos 3.1 因此進一步推進了世界模型的端側部署。
數據顯示,在 NVIDIA Jetson Thor 平臺、BF16 精度下,Kairos 3.1 8B 平均推理延遲為 125 毫秒,推理速度達到經典 VLA 模型水平。
![]()
最后,Kairos 3.1 還有一套狀態反思機制,如果出現操作失敗,系統會精準定位問題節點,觸發反思機制并調用平行空間推演能力,重新生成動作軌跡,然后再次執行。
基于理解、生成、預測三大能力的原生一體化融合,Kairos 3.1 形成的理解拆解 - 平行推演 - 動作輸出 - 真機執行 - 評估反思 - 迭代進化的完整自進化閉環,讓機器人大腦在真實作業中持續迭代、越用越強。
信息密度定律,什么樣的數據才能讓機器人變聰明
世界模型對物理世界的理解,建立在高質量數據之上。
大曉首次提出具身智能信息密度定律,并根據信息密度將具身數據劃分為 L1 至 L5 五個等級。L1 和 L2 主要包括前視單目或雙目視頻,以及文字標注。L3 和 L4 在此基礎上增加了全向環境感知、手部與身體姿態估計、多場景覆蓋和長程任務數據。L5 進一步加入精細的力觸覺信息、失敗后的恢復數據,以及開放環境中的連續交互數據。
![]()
大曉認為,當數據達到這一信息密度,模型才更有可能表現出跨任務泛化、自我反思和策略提升等能力。
基于這一判斷,大曉推出了環境式數采方案 2.0,由 ACE Ego Kit、ACE Data Engine 和 ACE Ego Matrix 三部分組成,分別承擔高密度信息采集、工業化自動標注和異構數據統一等任務。
![]()
ACE Ego Kit設備采用頭、手、胸三位一體的分體式設計,用于同時捕捉第一視角環境信息、手物交互細節和全身運動狀態。
其中,ACE Sense Glove 將三維力觸覺感知與手部動作捕捉集成在一副手套中,力觸靈敏度達到 0.01 牛頓,關節角誤差控制在 2 度以內。
ACE Data Engine把連續作業轉化為可訓練數據,該平臺具備標注維度完整、精度較高、支持長程任務等特點。針對手部姿態估計困難環節,大曉提出生成式 4D 手部動捕方法 ACE-ViDiHand,在遮擋、快速移動和復雜動作場景中取得了 0.997 的幀級準確率,將誤差降低 27 倍,動作平滑度提升 4.8 倍。
ACE Ego Matrix讓真人數據與跨本體數據能夠復用。獲得不同來源的數據后,如何完成統一和融合,是具身模型訓練面臨的另一項挑戰。
真人采集數據與機器人真機數據之間,存在差異,ACE Ego Matrix 由此承擔了具身數據標準化的工作。
它通過統一空間坐標、本體結構、動作時序和數據質量,使真人數據和不同機器人本體產生的數據能夠進入相對統一的表達空間,為跨本體訓練和數據復用提供基礎。
基于這一數據體系訓練的 ACE-Ego-0 模型,在 RoboCasa 和 RoboTwin 2.0 等評測中取得了領先結果,展示出面向不同任務和環境變化的魯棒性。
從高密度環境數據,到自動化標注,再到跨本體數據統一,大曉機器人正在建立一套完整的數據基礎設施。
從世界模型走進產業現場
世界模型最終需要進入真實場景,轉化為能夠持續工作的機器人系統。
大曉機器人此次帶來了三套行業解決方案,分別是面向即時零售履約的曉滿、面向酒店洗衣服務的曉新,以及面向全開放場景自主作業的曉途。
![]()
曉滿主要服務前置倉、閃電倉、傳統商超和倉店一體等業態。
該方案配套履約機器人 W1,針對即時零售 SKU 多、訂單密、節奏快以及倉儲空間狹窄等特點設計。W1 最小通行寬度僅 75 厘米,能夠在密集貨架之間移動,并通過力控機械臂和不同末端執行器,完成剛性商品、柔性包裝等多種物品的揀選、裝箱和搬運。
![]()
https://mp.weixin.qq.com/s/aSd-F7nPG26N74nmRlMsbw
目前,該方案已進入 Sense MartGo 燒賣購、快客達等客戶場景。
![]()
https://mp.weixin.qq.com/s/aSd-F7nPG26N74nmRlMsbw
即時零售之外,酒店洗衣也是一個高頻、剛需,卻長期依賴人工的服務場景。曉新覆蓋衣物收取、投放、洗滌、取出、分揀和折疊等環節,未來還計劃進一步加入掛燙能力,形成酒店洗衣服務的全流程閉環。
借助ACE-BRAIN 0.5的空間理解、長程規劃和狀態追溯能力,機器人可以識別洗衣機艙門、旋鈕、滾筒和衣物之間的空間關系,連續執行多個環節,并在步驟執行失敗時重新定位問題、調整操作。
![]()
https://mp.weixin.qq.com/s/aSd-F7nPG26N74nmRlMsbw
與零售前置倉和酒店洗衣房相比,開放環境的變量更多。曉途是一套面向開放場景自主作業的解決方案,目標是讓機器狗實現7×24 小時全天候自主運營。目前,相關機器人已經進入大型場館和園區開展安防與設施巡檢。
![]()
從機器人的大腦,到履約機器人 W1、四足機器狗,再到商品、訂單和云端管理系統,大曉正在嘗試打通模型、硬件與場景之間的完整鏈路。
世界模型,距離真正驅動機器人還有多遠
大曉機器人沒有把世界模型單獨視為一個視頻生成產品,也沒有等模型訓練完成后再尋找機器人場景。從項目開始之初,數據采集、模型架構、端側部署和行業方案就圍繞同一個目標展開,讓機器人在現實環境中理解、推演并完成任務。
不過,世界模型真正驅動機器人的標志,不會停留在視頻生成時長、模型參數或榜單名次上。它需要體現在機器人連續完成了多少真實任務,部署成本能否被客戶接受,經驗是否可以跨場景和跨本體復用。
背后更重要的變化是,世界模型產業正在告別單純比拼生成效果的階段。理解、生成、預測和行動之間的邊界開始消失,模型正在進入機器人的控制回路,接受物理世界的實時檢驗。
對于大曉機器人來說,速度已經幫助它拿到進入牌桌的資格。
世界模型驅動機器人這件事,答案不會在一年之內就完全揭曉,但大曉機器人用 ACE 范式、Kairos 技術驗證和曉滿、曉新、曉途的產業落地,至少讓大曉機器人成為這一輪世界模型路線討論中不可忽視的參與者。
正如王曉剛在演講結尾所說:大千世界,曉識萬象。
大曉希望與產業伙伴共同推動物理 AI 進入真實世界,讓具身智能逐漸成為兼具商業價值與社會價值的新型基礎設施。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.