![]()
新智元報道
![]()
上海,WAIC 2026。
核心官方分論壇之一、具身智能的「華山論劍」智啟具身論壇,今日終于開場。
Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics等海外明星機構,與智元、清華大學、騰訊Robotics X等學術與產業力量同臺,一眾具身智能核心人物悉數到場。
![]()
他們把各自的模型、數據和訓練體系擺上桌面。表面看,大家都在追逐「通用機器人」;真正把幾份技術路線疊在一起,卻是刀光劍影。
誰都承認,具身智能正在逼近臨界點。但對「最后一公里究竟該怎么走」,各有絕招。
具身智能的「最后一公里」,各有奇招
先亮戰績,再亮主張。五家最硬的成果和一句話立場擺出來,你會發現連「墻在哪」都沒談攏。
智元機器人手握GO-2(LIBERO基準98.7%刷新SOTA)、世界模型GE-Sim 2.0(WorldArena全球第一)、龍旗南昌產線穩定運行3個月、成功率99.99%。智元機器人的姚卯青直言,模型決定起點,數據定義終局——靠全棧飛輪硬沖數據、表征、閉環三道墻。
![]()
清華大學計算機副研究員蘇航,聚焦可恢復性——真正的智能不是不犯錯,是知道怎么改回來。他提出的TUTOR方法把長程任務的自主成功率從8.3%拉到35%。
![]()
Physical Intelligence最新的π0.7,一個模型開箱即通吃多任務,連沒訓練過的機械臂都能零樣本遷移。Physical Intelligence研究科學家任至意堅信,模型能力足夠,唯缺上下文——泛化會自己涌現。
![]()
Genesis押注人手數據手套,從全世界的日常家務里摳經驗,號稱仿真快1000倍。聯合創始人王尊玄介紹了他們如何讓物理AI以軟件的速度進化。
![]()
Dyna的DYNA-1把折餐巾做到99.4%、24小時85多張,直接開進真餐廳。創始人兼首席科學家馬也騁坦言,通用模型不夠可靠,專用模型不夠可擴展,他們選擇先把可靠做到極致。
![]()
絕招亮完,戰場卻各畫各的:智元盯著數據、表征、閉環三道墻,PI說墻是上下文,Dyna說是可靠性,清華說是機器人自救。
華山論劍第一招,是先否掉對方對戰場的判斷。
物理AI三道墻前,背后三場爭論
不過,這次有個隱秘共識:下一階段不再拼Demo花哨,而是拼誰能把「經驗」規模化。
這要從大語言模型的成功讓人產生的錯覺說起:
只要把模型做大、數據喂多、算力堆高,機器人遲早也會出現自己的ChatGPT時刻。
可物理世界不吃這一套。物理智能Scaling面臨三道墻:數據墻、表征墻和閉環墻。
![]()
姚卯青一句話點破差異:數字智能是「知識系統」,物理智能是「經驗系統」。前者靠語言表征就能大規模積累,后者還在滿世界找「經驗的通用表征」。
經驗系統至少管五件事:空間感知、物理交互、精細操作、失敗恢復、工具使用。
![]()
判斷標準叫「經驗密度」——錄畫面和關節角度,那是「一小時錄像」;同時記下任務目標、物體狀態、動作質量、錯在哪、結果如何,才叫「一小時經驗」。
數據規模回答「見過多少」,經驗密度回答「學到多少」。兩者差著一整條產業鴻溝。
背后是三場爭論:經驗從哪來、怎么算好、能不能省錢。
第一場:有人所有數據全都要,有人偏要少
真機遙操作數據最對口,可太貴:一個人盯一臺機器,采集還不如自己上手,想堆出互聯網規模,賬單比機器人先覺醒。
智元全都要。姚卯青甩出一個數字:物理AI的數據量只有大模型的兩萬分之一。為填這條溝,智元和覓蜂科技打造具身智能數據「平臺型供給」基礎設施,開源了行業首個百萬真機數據集AGIBOT WORLD,目前累計下載了120萬余次。
![]()
Dyna則把200k+小時數據摞成金字塔:
![]()
在之后的討論中,馬也騁分享了Dyna的實踐經驗:「部署數據放到下一次預訓練中,接下來的部署時間就會越來越短,最終達成零成本在新環境完成同樣任務。」
在圓桌論壇環節,Sunday Robotics CEO趙子豪則從另一個維度切入:「短期內,無本體數據是最高杠桿的選擇,因為成本極低、沒有環境差距。但長期來看,當機器人真正部署到多樣化環境中,部署數據將成為終極數據源。」
Genesis走的是「輕巧采集」路線:用接近人手的機器手配數據手套,讓人正常洗碗擰瓶蓋,順手留下動作。全世界每天都在干家務,摳出一小塊,機器人就有了接近人類活動規模的數據入口。
Dyna則反其道而行,它不比數據多,而是比用得省——20萬小時打底,卻主打「1小時以內的后訓練就能遷到全新任務」。別人拼彈藥,它拼槍法。
清華的蘇航則潑了一盆冷水:人手不是夾爪。人有全局視野、觸覺、常識,機器人常常只能從腕部相機看到巴掌大一塊。多塞人類動作,不等于機器人學會人類技能。數據多,不等于數據能用。
第二場:粗數據便宜但難學,精數據好用難量產
常規方法是「留成功、刪失敗」,像只給孩子看標準字帖。
PI偏押最臟的場景:讓機器人當咖啡師,做濃縮咖啡還要90%以上可靠——端著帶液體的杯子、拿捏出杯時機、精細力控,一步都不能崩。
它把成功和翻車一起錄:手柄掉了、牛奶灑了、插不進、出液早,再逐段貼標簽。不加說明就是噪聲,標清壞在哪就成了錯題集。從π0一路到π0.7,PI要讓一個模型看懂同一堆數據里的不同意圖和質量。它甚至給機器人寫系統提示詞:你是追求最高質量與效率的機器人,不要犯錯——像prompt大模型那樣操控物理策略。
Dyna嫌貼標簽不夠。它訓了套獎勵模型,讓機器人自評「這下做得好不好」,再靠持續學習吃進翻車經驗,硬磨出極端情況的糾錯力。
兩難就此浮現:粗數據便宜但難學,精數據好用難量產。平衡點極難拿捏。
第三場:讓機器人在夢里摔一萬次
真機太貴,能不能讓機器人「在夢里練」?
摔一萬次不砸真杯子,復制幾千個廚房不租真房子。Genesis管這叫「以軟件的速度進化」,號稱快 000倍。
智元補世界模型補得更狠。GE-Sim 2.0不只「生成合理的未來視頻」,還塞進本體狀態預測(State Expert)和任務結果判斷(World Judge),25幀推演一張H100上2.3秒,拿下WorldArena全球第一。
![]()
世界模型從「視頻導演」升級成能給狀態、能打分的訓練場。
爭議也最大。仿真里一個極小偏差,會在強化學習里被放大;機器人還可能學會鉆漏洞,在虛擬世界當「規則大師」,一落地就被一塊濕毛巾教做人。
Dyna和PI更相信真機數據:Dyna把機器人搬進真餐廳,PI靠真實數據飛輪和自主運行中的人工接管打磨。
仿真放大試錯,真機校準真實,誰多分預算,沒人服誰。
機器人的「ChatGPT時刻」還有多遠?
六位專家圓桌激辯
主題演講是各擺各的戰績,到了圓桌,六位專家則給出了火藥味的激辯。
主持人拋出的幾乎每個問題都很尖銳。
而分歧從哪來?先看清每個人代表了的不同背景,坐上桌的是:
姚卯青(智元機器人):全棧玩家,數據全要,可靠性是命;
任至意(Physical Intelligence):純大腦派,不碰場景,只賭真機數據飛輪;
馬也騁(Dyna Robotics):真實落地派,信部署數據和后訓練;
張正友(騰訊 Robotics X):大廠實驗室,分層架構,警告創業公司別被大模型吞了;
趙子豪(Sunday Robotics):家庭派,三指夾爪獨特方案,先敲門再說 。
每個人對技術路線的判斷,幾乎都是自己商業站位的投影。
1億小時:一個「ChatGPT時刻」的門檻
「語言模型頭部團隊已經到了100萬億Tokens,對應約100億小時的語料。而具身數據還差1萬倍以上。」智元合伙人、覓蜂科技董事長姚卯青給出了一個具體的數字。
在他看來,要達到物理世界的「ChatGPT時刻」——即機器人能夠在真實世界中開箱即用,完成日常任務并理解開放式指令——至少需要1億小時級別的真實交互數據。
這個數字并非空想。
姚卯青認為,物理世界比語言世界復雜得多,噪聲更大,信息冗余也更高。
當模型掌握了對物理世界通用運行規律的映射理解,從開放式指令理解到規劃,再到常見任務的70%-80%成功率,那一刻就是物理AI的臨界點。
VLA已死?技術路線的共識與分歧
「VLA已死」的說法在網絡上流傳甚廣。Physical Intelligence研究科學家任至意的回應干脆利落:「目前為止,我還沒有看到有哪一家做出了比派07更令人印象深刻的demo。所以,VLA可能還沒死。」
他堅持認為,VLA與世界模型并不沖突。「未來我們真正要做的,是訓練一個能原生理解上下文、能預測未來的模型。VLA在做,世界模型也在做,這完全不沖突。」
Dyna Robotics聯合創始人馬也騁,則提供了另一個視角——他們確實從VLA切換到了世界動作模型。「在某些任務和場景中,我們發現用WAM比VLA更高效,尤其是在我們特別關注模型的魯棒性和數據效率的情況下。」
騰訊Robotics X實驗室主任張正友給出了更宏觀的判斷:「整個行業還在起步階段,遠未收斂。不像大語言模型,基本范式已經確定。」
通用大腦,還是軟硬件全棧?全都要
機器人公司的另一項戰略選擇,是只做通用模型,還是同時研發模型、本體和部署系統。
Physical Intelligence更傾向于先使用簡單、穩定、維護成本較低的機器人本體,快速建立數據與模型研發基礎設施。
任至意認為,他們更多在做一個research,推動機器人基礎模型能力持續涌現。但他也提到:「長期來說,我們肯定會考慮去造更加可靠的硬件,但是可能這是一個時間的問題。」
智元則選擇了更重的全棧路線,足式,雙足或者輪式或者靈巧手都做。姚卯青解釋了背后原因,智元既做長期研究,也在積極嘗試商業化,而「商業化部署必須面對可靠性、成本、成功率和一致性等嚴格指標」。只有深入參與硬件設計、生產和測試,才能理解哪些問題來自模型,哪些問題實際上受到硬件和通信系統的限制。
![]()
張正友認為,兩條路線都可能成立。
在手機行業,蘋果依靠軟硬件一體化建立生態,Android則通過操作系統適配大量硬件;在PC時代,Mac和Windows也長期共存。機器人行業未來同樣可能同時存在全棧公司和通用「大腦」平臺。
關鍵不在于路線本身,而在于公司是否擁有與路線相匹配的資源和能力。
大廠vs創業公司:誰會贏?
「大廠的問題大家都很清楚。」張正友笑著說,「大模型時代,谷歌發明了幾乎所有技術,但OpenAI出來了。」
他給創業公司的建議是:不要做容易被大模型「吞噬」的增量式創新。「如果創業公司做的事情很容易被納入大廠的基座模型,前景就不會太好。應該聚焦在數據、場景這些需要深入耕耘的領域。」
馬也騁補充了一個技術視角:「機器人策略必須在本地運行,對延遲極其敏感。不像語言模型可以云端調用API。所以即使沒有開源模型,機器人公司也必須自研,這是不可避免的。」
騰訊的選擇是明確的——只做大腦,不做本體。「我們在硬件上還沒成功過,有自知之明。」張正友坦言。
ChatGPT時刻:2年到5年的共識
當被問及物理AI的「ChatGPT時刻」何時到來時,嘉賓給出了一個驚人的共識區間:不到5年。
姚卯青給出了最樂觀的2年;趙子豪說「少于3年」;張正友認為3-5年;馬也騁和任至意都選擇了4年;徐丹飛則給出5年。
平均來看,頂尖專家們認為物理AI的「ChatGPT時刻」大約在3-4年后到來。
「但要踏踏實實去做,這3到5年才有希望。」張正友補充道。
物理AI,已經臨近
圓桌結束了,但爭論遠未停止。VLA與世界模型誰是下一個目標?真機數據還是人類數據更有價值?全棧還是只做大腦?
這些問題沒有標準答案,但有一點是確定的:物理AI正在以遠超預期的速度向我們走來。
當數據飛輪真正轉動起來,當模型開始從與真實世界的每一次交互中學習,那道「Scaling Law的物理墻」,終將被推倒。
而那一天,或許就在2029年之前。
編輯:大衛 Aeneas
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.