大模型用了幾年時(shí)間證明了一件事:當(dāng)數(shù)據(jù)、算力和參數(shù)規(guī)模不斷增長(zhǎng),智能可以從量變中涌現(xiàn)。
但機(jī)器人正在發(fā)現(xiàn),這條路到了物理世界,沒有那么容易復(fù)制。
語言模型可以讀完整個(gè)互聯(lián)網(wǎng),機(jī)器人卻沒有一個(gè)現(xiàn)成的“物理互聯(lián)網(wǎng)”可以學(xué)習(xí);文本生成錯(cuò)誤,可以重新生成一次,機(jī)器人一次錯(cuò)誤的抓取,卻可能意味著杯子摔碎、生產(chǎn)線停機(jī),甚至真實(shí)的人身風(fēng)險(xiǎn);更重要的是,語言模型面對(duì)的是相對(duì)統(tǒng)一的 Token,而機(jī)器人面對(duì)的卻是千差萬別的身體、傳感器、環(huán)境和動(dòng)力學(xué)系統(tǒng)。
這或許是今天具身智能真正面臨的“物理墻”。
7月19日,在2026世界人工智能大會(huì)期間舉行的“智啟具身論壇2026”上,Physical Intelligence研究科學(xué)家任至意、Dyna Robotics聯(lián)合創(chuàng)始人兼首席科學(xué)家馬也騁、Sunday Robotics聯(lián)合創(chuàng)始人兼CEO趙子豪,與騰訊首席科學(xué)家、Robotics X實(shí)驗(yàn)室主任張正友,以及智元合伙人、覓蜂科技董事長(zhǎng)兼CEO姚卯青坐在了一起。
這場(chǎng)圓桌有一個(gè)頗具野心的主題:物理AI如何迎來通用智能涌現(xiàn)?
而且機(jī)器人大講堂注意到,非常有意思的是,幾位嘉賓代表的恰恰是當(dāng)下具身智能最不同的幾種路線。有人相信跨本體基礎(chǔ)模型,有人押注世界模型;有人把真實(shí)部署放在第一位,有人試圖利用UMI、人類第一視角視頻擴(kuò)大數(shù)據(jù)規(guī)模;還有人認(rèn)為,未來的具身智能必須是一個(gè)類似人類神經(jīng)系統(tǒng)的分層智能系統(tǒng)。
他們甚至對(duì)于“機(jī)器人的ChatGPT時(shí)刻什么時(shí)候到來”也給出了不同答案——最樂觀的是兩年,保守一些的是四五年。但如果把這場(chǎng)討論拆開來看,會(huì)發(fā)現(xiàn)一個(gè)比時(shí)間預(yù)測(cè)更值得關(guān)注的共識(shí)正在形成。幾位專家普遍認(rèn)為,具身智能下一階段真正要解決的,已經(jīng)不是如何再做出一個(gè)更驚艷的Demo,而是如何建立一套能夠持續(xù)生產(chǎn)物理經(jīng)驗(yàn)、吸收失敗,并在真實(shí)世界中不斷進(jìn)化的系統(tǒng)。
換句話說,大模型時(shí)代Scaling的是數(shù)據(jù)和參數(shù)。到了物理AI時(shí)代,真正需要被Scaling的,是“經(jīng)驗(yàn)”。
![]()
01.
機(jī)器人沒有互聯(lián)網(wǎng),這是物理AI最大的結(jié)構(gòu)性難題
如果今天重新追問一次,為什么ChatGPT能夠出現(xiàn)?答案很大程度上并不神秘。
過去幾十年,人類已經(jīng)替大語言模型完成了一次極其龐大的數(shù)據(jù)基礎(chǔ)設(shè)施建設(shè)。網(wǎng)頁、書籍、論文、代碼、論壇、社交網(wǎng)絡(luò)……這些原本并不是為了訓(xùn)練AI而產(chǎn)生的信息,在互聯(lián)網(wǎng)時(shí)代被大規(guī)模數(shù)字化,最終形成了一個(gè)幾乎取之不盡的Token世界。
機(jī)器人沒有這樣的幸運(yùn)。姚卯青在圓桌上給出了一個(gè)直觀的量級(jí)判斷:目前頭部語言模型的預(yù)訓(xùn)練語料已經(jīng)達(dá)到約100萬億Token,如果折算成人類正常說話的時(shí)間,大約相當(dāng)于100億小時(shí);相比之下,當(dāng)前具身智能的數(shù)據(jù)規(guī)模可能仍存在萬倍以上的差距。
而物理世界本身,比語言更加復(fù)雜。一個(gè)“把杯子放進(jìn)洗碗機(jī)”的動(dòng)作,在文本世界里可能只需要幾個(gè)Token,但對(duì)于機(jī)器人來說,它背后包含了物體識(shí)別、空間定位、材質(zhì)判斷、抓取姿態(tài)、碰撞關(guān)系、力度控制以及連續(xù)軌跡規(guī)劃。同一個(gè)動(dòng)作換一個(gè)杯子、換一臺(tái)洗碗機(jī)、換一種光照,甚至杯子里多一點(diǎn)水,都可能變成一個(gè)新的問題。
因此,姚卯青給出了一個(gè)激進(jìn)的判斷:如果將機(jī)器人的“ChatGPT時(shí)刻”定義為能夠開箱即用地進(jìn)入物理世界,根據(jù)開放式自然語言指令完成常見任務(wù),并在Zero-shot情況下達(dá)到70%—80%左右的基礎(chǔ)成功率,那么具身智能可能需要達(dá)到億小時(shí)級(jí)別的數(shù)據(jù)規(guī)模。
這個(gè)數(shù)字是否準(zhǔn)確,今天很難驗(yàn)證。
但它揭示了一個(gè)更關(guān)鍵的問題,那就是機(jī)器人行業(yè)真正缺少的,可能不是下一個(gè)Transformer,而是自己的互聯(lián)網(wǎng)。
這也是為什么過去一年,具身智能行業(yè)關(guān)于數(shù)據(jù)的路線開始迅速分化。真機(jī)數(shù)據(jù)最準(zhǔn)確,卻最昂貴;仿真數(shù)據(jù)可以無限生成,卻始終存在Sim-to-Real Gap;第一視角視頻數(shù)量巨大,卻缺少機(jī)器人可以直接執(zhí)行的動(dòng)作信息;UMI等無本體數(shù)據(jù)成本更低,卻仍然需要解決從人類動(dòng)作到機(jī)器人動(dòng)作的遷移。
因此,今天真正前沿的具身智能公司,實(shí)際上都在做同一件事情:
尋找機(jī)器人時(shí)代的“互聯(lián)網(wǎng)語料”。
只不過答案不同。
02.
真機(jī)、UMI、Ego、互聯(lián)網(wǎng)視頻,沒有一種數(shù)據(jù)可以單獨(dú)贏
如果說語言模型的數(shù)據(jù)路線最終逐漸收斂到了互聯(lián)網(wǎng)文本,那么具身智能的數(shù)據(jù)路線,至少今天仍然是一座金字塔。
最底層,是規(guī)模最大的互聯(lián)網(wǎng)視頻。再往上,是第一視角視頻、Ego、UMI等人類操作數(shù)據(jù)。更上層,是遙操作和多任務(wù)真機(jī)數(shù)據(jù)。而位于金字塔最頂端的,則是機(jī)器人進(jìn)入真實(shí)場(chǎng)景后產(chǎn)生的部署數(shù)據(jù)。
不同數(shù)據(jù)的價(jià)值,并不能簡(jiǎn)單用“質(zhì)量高低”來判斷。它們實(shí)際上承擔(dān)著完全不同的任務(wù)。
互聯(lián)網(wǎng)視頻幫助機(jī)器人理解“世界是什么”;人類操作數(shù)據(jù)告訴機(jī)器人“事情通常怎么做”;真機(jī)數(shù)據(jù)讓機(jī)器人學(xué)習(xí)“自己的身體應(yīng)該怎么動(dòng)”;而部署數(shù)據(jù)最終解決的是一個(gè)更現(xiàn)實(shí)的問題:
在這個(gè)具體環(huán)境里,怎樣才能穩(wěn)定地把事情做成。這也是這場(chǎng)圓桌中最值得注意的一個(gè)共識(shí)。
Physical Intelligence的任至意強(qiáng)調(diào)真機(jī)數(shù)據(jù)的價(jià)值,因?yàn)樗烊唤鉀Q了一個(gè)關(guān)鍵問題:如果一段動(dòng)作數(shù)據(jù)能夠在機(jī)器人上被Replay,并且重新完成任務(wù),那么這段數(shù)據(jù)與機(jī)器人真實(shí)執(zhí)行之間的偏差最小。但他同樣認(rèn)為,如果行業(yè)已經(jīng)決定混合Ego、UMI和真機(jī)等不同來源的數(shù)據(jù),那么就應(yīng)該進(jìn)一步擴(kuò)大本體多樣性。
原因很簡(jiǎn)單。通用機(jī)器人模型真正要學(xué)習(xí)的,不應(yīng)該只是某一臺(tái)機(jī)器人的動(dòng)作,而應(yīng)該是隱藏在不同身體背后的共同物理規(guī)律。
這也是PI一直試圖推動(dòng)的跨本體泛化。當(dāng)模型在一種機(jī)械臂上學(xué)習(xí)到的經(jīng)驗(yàn),可以遷移到另一種從未針對(duì)該任務(wù)訓(xùn)練過的機(jī)器人上,數(shù)據(jù)才真正開始從“一次性資產(chǎn)”變成“可復(fù)用知識(shí)”。
Sunday Robotics的趙子豪則把數(shù)據(jù)問題劃分成了兩個(gè)時(shí)間尺度。短期來看,他認(rèn)為UMI是一種極具效率的數(shù)據(jù)方案。原因在于,它同時(shí)兼顧了低成本和較低的動(dòng)作偏差,可以進(jìn)入大量真實(shí)環(huán)境采集人類操作經(jīng)驗(yàn)。
但長(zhǎng)期來看,真正決定機(jī)器人智能上限的仍然是部署數(shù)據(jù)。因?yàn)橹挥挟?dāng)機(jī)器人真正進(jìn)入成千上萬個(gè)家庭、酒店、工廠,面對(duì)不同的人、物體和環(huán)境,才能獲得足夠豐富的真實(shí)反饋。
趙子豪用了一個(gè)很有意思的類比:未來的機(jī)器人可能像分布式運(yùn)行的LLM。每一臺(tái)部署出去的機(jī)器人,既是產(chǎn)品,也是一個(gè)數(shù)據(jù)節(jié)點(diǎn)。它們不斷在真實(shí)世界中產(chǎn)生新的經(jīng)驗(yàn),再把經(jīng)驗(yàn)反饋給基礎(chǔ)模型,最終推動(dòng)整個(gè)機(jī)器人網(wǎng)絡(luò)共同進(jìn)化。
這意味著一個(gè)重要變化,那就是未來機(jī)器人公司的競(jìng)爭(zhēng),可能越來越像自動(dòng)駕駛,而不是傳統(tǒng)工業(yè)機(jī)器人。
賣出去的機(jī)器人越多,覆蓋的環(huán)境越復(fù)雜,產(chǎn)生的數(shù)據(jù)越豐富,模型就越強(qiáng);模型越強(qiáng),又能夠進(jìn)入更多場(chǎng)景。硬件出貨第一次可能與AI能力增長(zhǎng)形成直接的正反饋。
03.
機(jī)器人真正需要學(xué)會(huì)的,是失敗
但只有數(shù)據(jù)規(guī)模仍然不夠。因?yàn)槲锢硎澜绾突ヂ?lián)網(wǎng)世界還有一個(gè)本質(zhì)區(qū)別,互聯(lián)網(wǎng)上的大部分?jǐn)?shù)據(jù)記錄的是“結(jié)果”,真實(shí)世界卻充滿“過程中的失敗”。一個(gè)機(jī)器人抓取毛巾,可能抓空;拉開抽屜,可能卡住;疊餐巾時(shí),布料可能產(chǎn)生完全不可預(yù)測(cè)的形變。
傳統(tǒng)機(jī)器人系統(tǒng)面對(duì)這些問題的辦法,往往是增加規(guī)則。但規(guī)則越多,系統(tǒng)越脆弱。
這也是為什么Dyna Robotics把“部署”直接放進(jìn)了模型研發(fā)流程。馬也騁在圓桌中提到,當(dāng)機(jī)器人在前幾個(gè)酒店完成部署,并積累真實(shí)數(shù)據(jù)后,這些部署數(shù)據(jù)會(huì)重新進(jìn)入下一輪預(yù)訓(xùn)練。隨著數(shù)據(jù)不斷積累,后續(xù)酒店的部署周期可以越來越短,最終讓同一種技能接近“零成本遷移”。
這里真正值得關(guān)注的,不只是數(shù)據(jù)回流,而是機(jī)器人研發(fā)范式正在發(fā)生變化。
過去的機(jī)器人開發(fā)是一條線:研發(fā)——測(cè)試——交付。而具身智能正在試圖把它變成一個(gè)研究——部署——失敗——數(shù)據(jù)回流——模型更新——再次部署的環(huán)。
機(jī)器人一旦進(jìn)入真實(shí)世界,研發(fā)實(shí)際上并沒有結(jié)束。相反,真正的訓(xùn)練才剛剛開始。張正友也強(qiáng)調(diào),具身智能的數(shù)據(jù)飛輪不能簡(jiǎn)單照搬大模型的數(shù)據(jù)飛輪,因?yàn)闄C(jī)器人必須和物理世界發(fā)生真實(shí)交互。
成功數(shù)據(jù)當(dāng)然重要,但失敗數(shù)據(jù)可能更加重要。機(jī)器人為什么失敗?失敗之后如何恢復(fù)?什么情況下需要人類介入?這些過去被工程系統(tǒng)當(dāng)作異常處理的數(shù)據(jù),未來可能恰恰是機(jī)器人智能增長(zhǎng)最有價(jià)值的部分。
這背后意味著,具身智能正在從“模仿人類正確答案”,逐漸進(jìn)入“學(xué)習(xí)如何面對(duì)錯(cuò)誤”的階段。
而真正的通用智能,可能恰恰誕生在這里。因?yàn)楝F(xiàn)實(shí)世界沒有永遠(yuǎn)正確的軌跡。一個(gè)只能執(zhí)行標(biāo)準(zhǔn)答案的機(jī)器人,本質(zhì)上仍然是一臺(tái)自動(dòng)化設(shè)備。一個(gè)能夠發(fā)現(xiàn)自己做錯(cuò)了、重新規(guī)劃,并從錯(cuò)誤中形成新經(jīng)驗(yàn)的機(jī)器人,才開始真正接近智能體。
04.
VLA會(huì)不會(huì)死并不重要
數(shù)據(jù)之外,過去一年具身智能行業(yè)另一個(gè)爭(zhēng)論,是VLA與世界模型,甚至出現(xiàn)了“VLA已死,World Action Model當(dāng)立”這樣的激進(jìn)判斷。但圓桌上的幾位技術(shù)負(fù)責(zé)人,反而沒有表現(xiàn)出太強(qiáng)的路線戰(zhàn)爭(zhēng)。
任至意的觀點(diǎn)很直接:至少目前,還沒有看到哪一種路線能夠在整體能力上明顯超過PI最新模型所展現(xiàn)出的效果,因此現(xiàn)在討論“VLA已死”為時(shí)過早。
更重要的是,VLA和世界模型并不存在根本沖突。一個(gè)真正通用的機(jī)器人模型,既需要理解語言和任務(wù)上下文,也需要預(yù)測(cè)未來。它不僅要知道“我要做什么”,還必須理解“如果我這樣做,世界接下來會(huì)發(fā)生什么”。
馬也騁也認(rèn)同這一點(diǎn)。Dyna從VLA進(jìn)一步轉(zhuǎn)向World Action Model,并不意味著語言、視覺和動(dòng)作建模失去價(jià)值,而是在某些對(duì)成功率和魯棒性要求極高的任務(wù)中,對(duì)未來狀態(tài)進(jìn)行顯式建模可能更加高效。
因此,今天行業(yè)真正發(fā)生的事情,可能不是VLA被世界模型取代,而是不同技術(shù)路線正在開始融合。語言負(fù)責(zé)理解意圖,視覺負(fù)責(zé)理解環(huán)境,世界模型預(yù)測(cè)未來,Action Model生成動(dòng)作,強(qiáng)化學(xué)習(xí)處理真實(shí)反饋。
最終,機(jī)器人可能根本不存在一個(gè)簡(jiǎn)單的“三字母終局”。這也是張正友提出分層智能架構(gòu)的原因。他認(rèn)為,一個(gè)真正接近AGI的具身智能體,很難依靠一個(gè)3B、5B甚至10B的小模型解決全部問題。
更現(xiàn)實(shí)的形態(tài)可能是:高層認(rèn)知系統(tǒng)負(fù)責(zé)復(fù)雜推理和規(guī)劃,中層模型負(fù)責(zé)感知與行動(dòng),底層系統(tǒng)負(fù)責(zé)高頻運(yùn)動(dòng)控制。不同系統(tǒng)運(yùn)行在不同頻率,卻可以端到端協(xié)同優(yōu)化。
姚卯青進(jìn)一步從硬件角度解釋了為什么分層可能成為必然。今天機(jī)器人端側(cè)算力很難讓一個(gè)數(shù)百B參數(shù)的大模型以高頻率直接控制機(jī)器人,而底層電機(jī)控制卻可能需要達(dá)到1000Hz。于是,未來機(jī)器人天然可能形成一種“云—端—控制”分層體系:云端大模型進(jìn)行低頻復(fù)雜推理,端側(cè)模型進(jìn)行實(shí)時(shí)規(guī)劃,最底層控制器負(fù)責(zé)毫秒級(jí)執(zhí)行。
這意味著,具身智能最終可能不會(huì)復(fù)制大語言模型“一個(gè)模型統(tǒng)治一切”的路徑。它更像一個(gè)數(shù)字神經(jīng)系統(tǒng)。智能不是集中在某一個(gè)模型里,而是分布在不同層級(jí)之間。
05.
下一場(chǎng)競(jìng)爭(zhēng),是誰先讓“數(shù)據(jù)飛輪”轉(zhuǎn)起來
當(dāng)討論回到商業(yè)競(jìng)爭(zhēng),一個(gè)更加現(xiàn)實(shí)的問題出現(xiàn)了:如果OpenAI、Google、騰訊這樣的公司真正全面進(jìn)入機(jī)器人基礎(chǔ)模型,創(chuàng)業(yè)公司還有機(jī)會(huì)嗎?
答案可能取決于,機(jī)器人行業(yè)最終是不是一個(gè)純粹的軟件行業(yè)。馬也騁認(rèn)為,機(jī)器人Policy很難完全復(fù)制云端API模式。因?yàn)闄C(jī)器人對(duì)于實(shí)時(shí)性、延遲和真實(shí)執(zhí)行性能的要求極高,核心模型最終很大程度仍然需要Local運(yùn)行。
張正友則用了PC和智能手機(jī)產(chǎn)業(yè)做類比。機(jī)器人產(chǎn)業(yè)未來完全可能同時(shí)存在兩種模式。一種類似蘋果,全棧整合模型、硬件和系統(tǒng)。另一種類似Windows或者Android,提供通用大腦,適配不同機(jī)器人本體。
這兩條路線都可能成立。真正危險(xiǎn)的,是那些既沒有基礎(chǔ)模型壁壘,也沒有真實(shí)場(chǎng)景、數(shù)據(jù)閉環(huán)和硬件能力的中間層公司。因?yàn)殡S著基礎(chǔ)模型能力不斷提高,大量通用能力最終都會(huì)被底層模型吸收。
創(chuàng)業(yè)公司的護(hù)城河,可能越來越集中到三件事情:獨(dú)占的數(shù)據(jù)、深入的場(chǎng)景,以及高效的部署閉環(huán)。這也解釋了為什么今天看似路線完全不同的具身智能公司,最終都開始走向數(shù)據(jù)。
PI通過跨本體真機(jī)數(shù)據(jù)尋找通用策略。Dyna通過商業(yè)部署建立研究—部署飛輪。Sunday希望未來讓家庭機(jī)器人形成分布式數(shù)據(jù)網(wǎng)絡(luò)。騰訊強(qiáng)調(diào)成功與失敗交互數(shù)據(jù)共同進(jìn)入持續(xù)學(xué)習(xí)。智元與覓蜂則試圖從數(shù)據(jù)供給和全棧系統(tǒng)角度建立覆蓋互聯(lián)網(wǎng)數(shù)據(jù)、Ego、UMI、真機(jī)數(shù)據(jù)與部署回流的完整數(shù)據(jù)體系。
表面上看,這是五種路線。
實(shí)際上,它們正在指向同一個(gè)產(chǎn)業(yè)終局,那就是未來最重要的機(jī)器人公司,可能不是擁有最多機(jī)器人數(shù)據(jù)的公司,而是擁有最高“經(jīng)驗(yàn)周轉(zhuǎn)率”的公司。
所謂經(jīng)驗(yàn)周轉(zhuǎn)率,是機(jī)器人經(jīng)歷一次真實(shí)任務(wù)后,這段經(jīng)驗(yàn)?zāi)軌蚨嗫毂徊杉⒑Y選、理解、訓(xùn)練,再重新變成所有機(jī)器人能力的一部分。
如果一臺(tái)機(jī)器人犯錯(cuò),只有這一臺(tái)機(jī)器人知道,它只是一次事故。如果一臺(tái)機(jī)器人犯錯(cuò),第二天所有機(jī)器人都學(xué)會(huì)了如何避免,那么這才是數(shù)據(jù)飛輪。
從這個(gè)意義上看,物理AI真正需要突破的Scaling Law,已經(jīng)不只是把數(shù)據(jù)從1萬小時(shí)增加到10萬小時(shí)、100萬小時(shí)。更重要的是建立一種新的工業(yè)基礎(chǔ)設(shè)施,讓人類經(jīng)驗(yàn)可以被低成本采集,讓機(jī)器人經(jīng)驗(yàn)可以被持續(xù)記錄,讓失敗可以被自動(dòng)挖掘,讓不同本體的數(shù)據(jù)能夠互相遷移,讓真實(shí)部署產(chǎn)生的數(shù)據(jù)可以不斷進(jìn)入下一輪模型。
當(dāng)這個(gè)系統(tǒng)真正建立起來之后,機(jī)器人行業(yè)才可能擁有屬于自己的“互聯(lián)網(wǎng)”。而所謂機(jī)器人的“ChatGPT時(shí)刻”,也許并不會(huì)發(fā)生在某個(gè)模型發(fā)布的那一天。
它更可能發(fā)生在另一個(gè)不那么戲劇性的時(shí)刻:當(dāng)?shù)谝慌鷻C(jī)器人真正大規(guī)模進(jìn)入物理世界之后,它們每天產(chǎn)生的經(jīng)驗(yàn),開始比人類能夠人工采集的數(shù)據(jù)更多;每一次部署都在降低下一次部署的成本;每一臺(tái)新增機(jī)器人,都在讓整個(gè)系統(tǒng)變得更聰明。
到了那個(gè)時(shí)候,Scaling Law才真正從數(shù)字世界跨過那堵“物理墻”。
06.
關(guān)于未來
圓桌最后,五位嘉賓給出了自己的時(shí)間表。
姚卯青認(rèn)為是兩年,趙子豪判斷不到三年,馬也騁給出了四年,任至意從過去認(rèn)為需要十年調(diào)整到了四五年,張正友則認(rèn)為三到五年有希望。
他們沒有給出同一個(gè)數(shù)字。但他們實(shí)際上給出了同一個(gè)前提:機(jī)器人必須先進(jìn)入真實(shí)世界。
因?yàn)榇笳Z言模型的智能,來自人類已經(jīng)數(shù)字化的過去。而物理AI的智能,需要機(jī)器人自己去創(chuàng)造未來的數(shù)據(jù)。
模型決定機(jī)器人能不能出發(fā),數(shù)據(jù)決定它最終能夠走多遠(yuǎn)。
真正的物理AI競(jìng)爭(zhēng),或許才剛剛開始。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.