![]()
作者|華衛(wèi)
2026 年的具身智能賽道,正在經歷一場悄無聲息的“技術路線大分流”。主角正是機器人模型,機器人能做什么、不能做什么,就取決于這一“大腦”。
英偉達 GTC 大會上,火藥味第一次被擺到了臺面上,吉利、Momenta、華為等重量級玩家公開質疑 VLA 的局限性。而大火的“世界模型”,以及越來越多被提及的 VA 路線從不同方向給出了各自的答案。最具戲劇性的一幕是,作為 VLA 概念的共同開創(chuàng)者,Generalist AI 團隊公開表示要“拋棄”VLA 乃至世界模型的標簽,認為“過于在意工具的標簽,反而會限制通往物理 AGI 的想象力”。
這場“口頭站隊”持續(xù)了幾個月,到現(xiàn)在,具身智能已進入了“落地祛魅”的新階段。爭論的聲量變小,模型發(fā)布變多,核心的較量從“誰是對的”變成了:機器人到底動起來沒有。剛結束的 WAIC 上,機器人展品不再是“能動的演示”,而是圍繞 3C 電子、汽車制造、倉儲物流等真實場景展開的應用展示。
更值得注意的變化是,大家開始心照不宣地開始做“路線混搭”。
吵了半年,頭部玩家卻在悄悄“混搭”
剛剛落幕的 WAIC 已經釋放出了一個清晰的信號:具身廠商們展示的模型已經從去年的以 VLA 為主,變成了今年的“世界模型+VLA”占絕大多數(shù)。不過,各個廠商對世界模型的定位不盡相同,有些內置在模型中,用于學習物理規(guī)律和決策前預演,有些則把世界模型和 VLA 作為獨立模型共同開發(fā)。
智平方創(chuàng)始人兼 CEO 郭彥東在今年的智源大會上給出了一個明確的判斷:世界模型不是 VLA 的競爭路線,而是 VLA 體系中的核心組成部分。“世界模型負責理解世界,而 VLA 負責作用于世界,兩者并非對立關系,而是天然統(tǒng)一的整體”。
星海圖同樣在走融合路線。其 CEO 高繼揚明確表示:“我們一直不認為 VLA、世界模型是對立的,兩者底層邏輯相通,都基于 Transformer 對交互數(shù)據(jù)做處理,區(qū)別主要在監(jiān)督方式與架構細節(jié),未來越來越會走向融合。 ”據(jù)了解,星海圖堅持“VLA+WAM”雙技術路線,VLA 保障實時操作,WAM 提供前瞻推演,兩者協(xié)同實現(xiàn)從“感知-決策-執(zhí)行”到“預判-優(yōu)化-閉環(huán)”的能力提升。
小鵬汽車通用智能中心負責人劉先明也表示,世界模型與第二代 VLA“不是互相替代或互相競爭的關係,而是透過不同訓練訊號共同提升模型對物理世界的理解能力”。在 CVPR 2026 上,小鵬首次完整呈現(xiàn)了物理世界基座模型的技術圖譜。劉先明進一步強調,只有能做基座模型的公司,才有可能真的做到 L4,自動駕駛只是第一步,未來還將應用到機器人、飛行汽車等更多具身載體。
從“二選一”到“都要用”,這是半年爭吵后行業(yè)給出的第一個實際答案。
Gartner 研究副總裁高挺指出,“未來一兩年,VLA 大概率仍然會是機器人動作模型的主體,但世界模型會逐步融入 VLA 系統(tǒng),為機器人提供更強的物理理解、規(guī)劃和預演能力。長期來看,更有可能出現(xiàn)的是 VLA 與世界模型的融合,而不是世界模型簡單取代 VLA。”
VLA 的“自救”與升級
盡管泛化能力被質疑,但過去幾個月,VLA 模型的更新反而進入了一個小高潮,只是方向變了。
螞蟻靈波 7 月開源的 LingBot-VLA 2.0,在預訓練階段融入 6 萬小時真實物理數(shù)據(jù),含 5 萬小時覆蓋單/雙臂、雙足/輪式等多形態(tài)的真機軌跡,覆蓋樂聚、智元、宇樹、松靈等 17 個廠商的 20 種機器人構型,以及 1 萬小時第一視角人類操作精煉數(shù)據(jù)。在 GM-100 雙臂操作通用任務評測中,其總體平均任務進度分和成功率均領先于π0.5 與 GR00T N1.7。推理延遲在 RTX 4090 上控制在 130 毫秒以內。
這指向一個明確的產品化方向:一個“通用大腦”適配多種機器人。
靈波還表示,從產業(yè)落地角度看,VLA 現(xiàn)在還不是一個“拿來即用、解決所有問題”的成熟形態(tài)。它更像是具身智能的基礎底座,能夠提供通用能力,再通過少量場景數(shù)據(jù)、后訓練工具鏈和本體適配,把能力遷移到具體機器人和具體任務上。未來兩到三年內,VLA 會與其他技術路線走向深度融合,并最終催生出專屬于物理世界的具身原生模型。
另外,VLA 要活下去,還得解決一個很現(xiàn)實的問題,那就是如何在機器人本地跑起來,而不是完全依賴云端。面壁智能在 WAIC 期間發(fā)布的 MiniCPM-Robot 系列,參數(shù)量僅 1.5B,卻在 LIBERO、Calvin 等主流 VLA 評測中進入第一梯隊。更關鍵的是,其單次決策延遲僅 120 毫秒,接近π0.5(234 毫秒)的一半。對真實機器人而言,這意味著動作更流暢、任務完成更快。
此外,傳統(tǒng) VLA 的一大痛點是“記不住”,只能根據(jù)當前一幀畫面做判斷。MiniCPM-RobotManip 通過納入歷史觀測和此前執(zhí)行的動作,在上下文記憶評測 RMBench 中拿到約 53 分,而π0.5 僅約 10 分,這讓機器人能完成疊衣服、做三明治這類包含一連串動作的長任務。
另一家國內企業(yè)擎?zhèn)}機器人同樣走輕量化路線。此前其推出了 Evo-1 率先驗證輕量化路線可行性,在不損失成功率的前提下,參數(shù)量更小,可面向具身智能真實應用場景,在降低單機算力配置成本的同時,實現(xiàn)完全端側部署和機器人實時控制。其聯(lián)合上海交大發(fā)布的 Evo-Depth,把空間感寫進 VLA 策略里,但參數(shù)量僅 0.9B,仿真端 Meta-World 達 84.4%、LIBERO 達 95.4%,真機平均成功率約 90%,部署側僅需約 3.2GB 顯存、約 12.3Hz 推理頻率。
VLA 沒有“死”,并且它正在變得更小、更快、更能干。
加速進化的世界模型
世界模型同樣在加速進化。如果說去年的世界模型還停留在“視頻生成”和“軌跡預測”的學術競賽中,那么時至今日的新成果已經指向了“行動一體化” 。
大曉機器人在 WAIC 上發(fā)布的開悟世界模型 Kairos 3.1,是這一趨勢的代表之一。它依托混合 Transformer 架構與共享混合注意力機制,用一套架構打通理解、生成、預測,將視覺觀測、語言指令、力觸狀態(tài)、策略軌跡等多維具身數(shù)據(jù)壓縮進統(tǒng)一隱空間,形成高密度表征向量,從底層實現(xiàn)三大能力的原生融合。這不再是單純的世界預測模型,而是一個能直接驅動行動的“行動一體化世界模型”。
大曉機器人董事長王曉剛點出了行業(yè)核心難題:“純數(shù)字 AI 生成出錯只會影響圖文內容,但機器人在真實物理環(huán)境里預判失誤,會造成實實在在、無法挽回的損失”。為此,Kairos 3.1 搭載了自主反思閉環(huán)機制,執(zhí)行失敗時可自主定位問題、迭代優(yōu)化動作策略。在硬件適配方面,Kairos 3.1 的 8B 版本在英偉達 Jetson Thor 平臺上單次推理僅 125 毫秒。它已在家務場景中展現(xiàn)出實用價值,比如洗衣服流程,機器人能自主拆分十余步操作,取衣、投放、開機、整理全程獨立完成,出錯后還能自動重試。
靈生科技合伙人蔣玉驊則提供了一個更冷靜的視角:目前工業(yè)界與學術界的世界模型,規(guī)模普遍都在 10B 以下,甚至沒有人畫出從幾十兆到幾百億參數(shù)的 Scaling Law 曲線。“對比大語言模型,具身智能大概相當于 GPT-3 之前的階段”。當外界被各種機器人跳舞、翻跟頭的 Demo 包圍時,底層模型的成熟度其實遠低于預期,數(shù)據(jù)和模型的雙向驅動將是下半場的硬核主線。
高挺也表示,“今天,通用機器人和人形機器人的前沿路線仍然以 VLA 為主。世界模型雖然發(fā)展很快,但目前更多用于合成數(shù)據(jù)生成、仿真、評估和輔助規(guī)劃,真正直接用于實體機器人控制的案例仍然比較早期。”
“都是過渡”,具身智能下一站通向哪?
如果說 VLA 和世界模型都在快速迭代,那行業(yè)對“終極答案”的態(tài)度反而變得更加謙遜了。
“VLA 與世界模型解決的是不同的問題。VLA 擅長人機交互和模態(tài)融合,而世界模型更擅長對未來狀態(tài)的預測。機器人既需要融合各種感官信息,也需要在行動前對結果有預判。因此,隨著機器人數(shù)據(jù)量的不斷積累,VLA 和世界模型路線將加速融合,形成優(yōu)勢互補的閉環(huán)智能能力,而我們也在加速這一方向的探索。”靈波表示。
這種探索已經落實到靈波的模型布局中。今年 1 月他們發(fā)布了 LingBot-VLA 和全球首個自回歸視頻-動作世界模型 LingBot-VA,并在 7 月升級至 2.0 版本,其中 LingBot-VA 2.0 是行業(yè)首個具身原生的世界動作模型。VA 2.0 根據(jù)機器人在物理世界中的感知、預測與行動需求,重新設計訓練目標和模型架構,并從頭開始預訓練。他們判斷,當前的 VLA 和世界模型都不是終局。隨著物理世界數(shù)據(jù)采集成本的降低和數(shù)據(jù)規(guī)模的擴大,觸覺、力覺、動作反饋以及對未來狀態(tài)的預測等能力可能進一步匯合,形成新的機器人大腦架構。
智平方則提出,類腦架構將成為下一代機器人大腦的重要演進方向。 智平方的類腦式具身智能系統(tǒng) NeuroVLA,仿生人類大腦的“皮層—小腦—脊髓”三層體系,皮層負責深度推理規(guī)劃,小腦保障動作靈巧穩(wěn)定,脊髓實現(xiàn)本能極速反應。本質上說,這種分層架構是在 VLA 和世界模型之上再做一層系統(tǒng)級整合。
而在另一邊,Generalist AI 選擇了一條“離經叛道”的路。這家由 VLA 開創(chuàng)者創(chuàng)辦的公司,正在試圖跳過所有中間標簽,不依賴任何已有路線,不走微調 VLM 加動作頭的捷徑,也不宣稱自己是世界模型。
他們從第一性原理出發(fā)得出的結論是:想要實現(xiàn)物理 AGI,最好的方式或許就是“從零訓練”這條看似不好走的路。其新發(fā)布的 GEN-1 模型大約 99%的參數(shù)都是從零開始訓練,不基于任何現(xiàn)有的基礎模型,但已在三個維度實現(xiàn)跨越:成功率超過 99%,速度提升 2-3 倍,僅需上代模型 1/10 的數(shù)據(jù)和微調。
2026 年上半年,國內具身智能賽道融資總額達 934.74 億元,較 2025 年同期暴漲約 5 倍;融資事件 322 筆,同比增長 137%。工信部在 2026 世界人工智能大會新聞發(fā)布會上表示,今年我國人形機器人全年整機產量有望突破 10 萬臺。
但對比大語言模型的清晰演進路徑,具身智能至今仍沒有一張被完整驗證過的技術路線圖。VLA 和世界模型的路線之爭,只是具身這個故事的第一章。接下來的分水嶺是,讓機器人真正動起來。而這一章的主角不會是某個技術標簽,是否足夠可靠、是否能夠規(guī)模化,是否真的讓機器人本體走進產線與家庭并完成任務,才決定了這條路線的生死。
正如 Generalist AI 團隊所說,目標永遠比工具的標簽更重要。
聲明:本文為 AI 前線原創(chuàng),不代表平臺觀點,也不構成投資建議,未經許可禁止轉載。
會議推薦
2026 年 AICon 人工智能開發(fā)與應用大會 · 深圳站將于 8 月 21 日—22 日舉辦,聚焦 AI 基礎設施、大模型系統(tǒng)、智能體工程、數(shù)據(jù)智能、多模態(tài)技術與行業(yè)落地等關鍵方向,邀請來自騰訊、阿里、華為、百度、螞蟻集團等 50 + 頭部科技企業(yè)技術負責人、科研機構一線專家,系統(tǒng)性分享前沿洞察與實戰(zhàn)干貨,共同探討 AI 技術從能力到系統(tǒng)、從實驗到生產的真實路徑。限時 9 折專屬優(yōu)惠,現(xiàn)在報名立減 580,更多詳情可掃碼或聯(lián)系票務經理 13269078023 進行咨詢。
今日薦文
你也「在看」嗎?
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.