![]()
模型決定起點,數據定義終局。
作者 /新物種
2026年盛夏,上海世博中心,世界人工智能大會(WAIC)如約而至。如果說前幾屆大會的焦點是數字世界中的大模型參數競賽,那么今年,聚光燈無疑打向了一個更富挑戰性的領域:物理AI。
大會期間,中國向全球宣布支持人工智能發展與國際合作的重要舉措,釋放出進一步推動AI開放創新的信號。隨著人工智能從實驗室走向產業,全球AI競爭也正在進入一個新的階段:從單純追求模型能力突破,轉向探索如何讓智能真正進入現實世界。
7月19日,一場名為“智啟具身”的論壇,匯聚了來自Physical Intelligence(PI)、Genesis AI、Dyna Robotics、騰訊Robotics X、Sunday Robotics、智元及覓蜂科技等全球具身智能領域的代表力量。
與過去圍繞大模型參數規模、訓練算力展開的討論不同,這場論壇的議題更加底層,也更加緊迫:當Scaling Law在數字世界推動大模型不斷突破,而機器人進入現實世界后遭遇數據稀缺、物理規律復雜以及長尾場景不可預測等限制,下一階段的智能增長究竟依靠什么?
這不僅是本次論壇的核心懸念,也是當前具身智能產業最大的時代之問。
01.
技術路線四路交匯:尋找物理世界的Scaling路徑
過去幾年,以大語言模型為代表的數字智能證明了一條路徑:數據規模越大、模型參數越多、算力越強,智能涌現的效果就越顯著。然而,當人工智能試圖從數字空間進入物理世界時,它面臨的是完全不同的數據環境。語言模型學習的是互聯網上已沉淀的數字信息,而機器人需要學習如何感知、理解并作用于一個不斷變化的物理世界。一次簡單的抓取動作,背后不僅包含視覺理解與語言指令,還涉及物體屬性、空間關系、力度控制以及接觸后的實時反饋。
當前,具身智能領域并不存在一條已被證明絕對正確的技術路徑。不同團隊正從不同角度探索通往通用機器人的路線,而這些探索的背后,本質上對應著對“智能如何產生”的不同理解。
Physical Intelligence(PI)代表的VLA(Vision-Language-Action)路線,是當前最接近大模型發展邏輯的路徑之一。其核心思路是將視覺、語言和動作統一到一個基礎模型中,讓機器人通過大規模經驗數據學習通用能力。
![]()
PI研究科學家任至意在論壇現場分享了π系列模型的演進歷程:從π0到π0.5、π0.6,再到2026年4月發布的π0.7,PI通過不斷擴大機器人訓練數據規模,追求更強的泛化能力。據介紹,π0.7已在部分未見場景中實現了超過80%的任務成功率,且無需針對具體任務進行微調。
值得注意的是,PI在最新模型中引入了更豐富的上下文信息,包括詳細的視覺歷史、密集的多模態語言指令,甚至對數據質量的元信息標注,讓模型能夠理解不同數據的價值。任至意認為,π0.7已經展現出一種“可控的涌現能力”,即通過精準的提示指引,一個模型可以完成疊衣服、操作空氣炸鍋等從未見過的任務,甚至實現了跨本體的技能遷移。
不過,VLA路線也面臨一個關鍵質疑:機器人不能僅靠“看到”來完成任務,它必須理解任務背后的物理過程。對于語言模型而言,“拿起杯子”是一段文本描述;但對于機器人而言,這意味著識別杯子的位置與材質、判斷重量、控制抓取力度,并根據接觸反饋不斷調整動作。
這也是為什么世界模型路線開始受到越來越多關注。
清華大學計算機系副研究員蘇航在演講中指出,具身智能并非簡單地將大語言模型能力遷移到機器人身上,而是需要構建面向物理交互的新型基礎模型。在他看來,具身智能需要也值得擁有自己領域的原生大模型,因為許多物理操作(如打螺絲、炒菜、拉拉鏈)很難僅用語言和圖像完整描繪。他提出,未來的具身模型應當綜合利用遙操數據、無本體數據、互聯網視頻以及人類第一視角數據,構建一個統一的概率空間建模框架,將預測、感知和行動融合為一體。
![]()
蘇航團隊的實驗表明,世界動作模型在任務泛化能力上明顯優于傳統VLA,即當任務數量增多時,VLA模型容易出現性能退化,而世界動作模型則能保持穩定甚至持續提升。
仿真與真實數據路線則從另一個維度回應了數據稀缺的挑戰。
Genesis AI聯合創始人王尊玄強調,機器人問題本質上是一個系統工程問題。相比大模型可以直接利用互聯網數據訓練,機器人需要同時解決硬件、數據采集、訓練環境、評估體系以及部署等多個環節。Genesis AI的探索重點在于構建高保真仿真環境,將其作為模型評測和強化學習后訓練的核心平臺。其核心邏輯是:如果能夠構建出與真實高度一致的仿真環境,那么機器人訓練就可以像代碼Agent一樣,通過大規模并行計算來縮放,將物理問題轉化為計算問題。
王尊玄同時指出,仿真與真實之間的差距(Sim-to-Real Gap)仍然是行業長期需要解決的問題。當前仿真環境與真實環境的相關性雖已提升,但物理世界中物體摩擦、光照變化、接觸關系等不確定因素依然難以被完全模擬。
Dyna Robotics所代表的真實數據路線,則更加關注機器人在真實環境中如何獲得持續穩定的能力。其聯合創始人兼首席科學家馬也騁認為,具身智能要產生真正的商業價值,模型必須具備極高的可靠性和成功率。為此,Dyna Robotics在部署場景中構建了一套完整的獎勵函數模型,通過實時評估任務進度來精準定位錯誤環節,再針對性地采集恢復數據。
![]()
正是通過這種“部署—反饋—再訓練”的循環,Dyna的機器人在餐廳折餐巾任務中實現了24小時不間斷運行、累計完成800余件的高可靠性表現。馬也騁強調,部署回流數據是整個數據金字塔的頂端,雖然數量最少,但質量最高、價值最大,能夠顯著加速后續場景的部署效率。
從論壇中四位前沿研究者的討論來看,這些路線之間并非簡單的競爭關系。VLA需要世界模型提升物理理解,世界模型需要真實數據進行校準,仿真需要現實反饋來修正偏差,而真實機器人部署又需要基礎模型和仿真環境來提高效率。行業正在從尋找“唯一答案”,轉向探索一個融合式架構。
而在這個架構背后,一個更關鍵的問題逐漸浮現:當模型能力逐漸提升之后,下一階段真正限制具身智能發展的,到底是什么?
答案正在指向數據。
02.
數據飛輪:沖破物理世界的三重圍墻
如果說大模型時代最寶貴的資源是互聯網上已數字化的海量信息,那么具身智能時代最稀缺的資源,則是能夠真實反映物理交互的高質量數據。這是機器人區別于語言模型最大的挑戰:它無法通過閱讀文本獲得抓取、移動、裝配等技能,而必須通過一次次實際行動,與環境發生交互,再從結果中學習。
智元合伙人、覓蜂科技CEO姚卯青在開篇演講中將這一挑戰總結為“三道墻”:數據墻,真實交互數據極其稀缺,獲取成本遠高于爬取網頁信息;表征墻,缺少跨任務、跨場景、跨本體的統一物理表征,各領域“各自為戰”;閉環墻,在真實世界中試錯代價昂貴,一次失敗可能導致硬件損壞,反饋周期長且難以規模化。
在這三道墻中,數據墻是當前最直接、最緊迫的限制。姚卯青在演講中透露,部分真實機器人數據的采集成本約為每小時1000元。這意味著,具身智能無法像語言模型那樣依靠簡單擴大數據規模來獲得能力提升,企業必須探索更高效的數據生產方式。
![]()
覓蜂科技提出的“數據金字塔”模型代表了一種典型探索:底層是海量的互聯網視頻數據,幫助模型建立對世界的基本認知;中間層是通過MEgo系列無本體采集設備獲得的第一視角交互數據,包括MEgo Gripper(高精度物理交互采集)和MEgo View(多視角頭戴式采集系統),這些設備可以讓人走進真實場景全天候采集數據,同時通過自研VIO算法實現毫米級空間軌跡精度和亞毫秒級多傳感器時間同步;頂層則是最高價值的真機數據和部署回流數據。
值得注意的是,覓蜂科技在數據治理環節也構建了核心壁壘。其MEgo Engine一站式數據治理平臺,能夠將長達數小時的原始視頻自動切分為幀級精準的原子技能單元,語義打標準確率超過98%,目前已構建起涵蓋十大動作類、120余種原子動作的技能圖譜。這種將非結構化的物理交互過程轉化為結構化、可復用數據資產的能力,正在成為數據飛輪能否有效運轉的關鍵。
而在真實數據之外,仿真也在重新定位自身的角色。它不再被視為真實數據的替代品,而是數據體系中的一個有機組成部分,即通過大規模仿真擴大數據規模,再利用真實環境反饋不斷修正模型,讓機器人訓練逐漸接近大模型時代的規模化路徑。姚卯青在總結中提出:“模型決定了企業進入賽道的起點,而持續產生數據的能力,決定最終能夠走多遠。”
03.
從“堆參數”到“建循環”:具身智能競爭范式的切換
縱觀整場論壇,一個清晰的變化正在發生:具身智能的競爭正在從單一的模型能力比拼,轉向“模型—數據—部署”三位一體的系統能力競爭。誰能夠讓機器人規模化進入真實環境,誰就擁有了持續獲得高質量數據的機會,這也正在成為新一代具身智能企業的核心護城河。
這種轉變在多家企業的實踐中得到印證。PI通過將機器人部署到真實的Airbnb家庭環境中采集多樣化數據,再結合數據質量標注和錯誤數據回流,構建了從π0到π0.7的持續迭代飛輪。Dyna Robotics則通過在餐廳、洗衣房等真實場景中部署,將部署反饋數據重新注入預訓練,使后續新場景的部署時間不斷縮短。智元與覓蜂更是將“百臺機器人集群在線強化學習”變為現實,在嘉興的實驗場地中,超過100臺機器人通過“云—邊—端”協同組網,實時上報交互經驗,模型權重可在2秒內下發到所有機器人,訓練周期從天級壓縮到分鐘級。
這些實踐共同指向一個趨勢:具身智能的未來,不是由某一次模型突破單獨定義的,而是由一套能夠持續產生數據、持續優化模型、持續擴展能力的系統所決定的。就像姚卯青在演講結尾所說的那樣:“模型決定起點,數據定義終局。只有飛輪真正轉動起來,智能涌現才會出現。”
04.
全球競合與“ChatGPT時刻”的共識
從WAIC這場論壇可以觀察到,全球具身智能產業正在形成差異化的競爭格局。
海外企業更多從基礎模型和單點技術創新切入:PI致力于打造通用具身大腦,Genesis AI試圖通過系統化方式解決機器人工程難題,Dyna Robotics則強調真實場景中的可靠部署。而中國企業正在探索另一條路徑:不僅關注模型本身,也試圖打通機器人本體、數據采集、部署場景和制造能力。
![]()
而在論壇圓桌環節結尾,一個核心問題被提及:機器人距離自己的“ChatGPT時刻”還有多遠?
不同嘉賓給出了各自的判斷。姚卯青認為大約需要兩年,主要取決于數據方面的進展;Physical Intelligence研究科學家任至意表示,自己曾認為需要十年,如今可能縮短到四五年;Dyna Robotics聯合創始人馬也騁判斷約為四年;騰訊Robotics X負責人張正友則預估三到五年,但強調需要“踏踏實實去做”;Sunday Robotics聯合創始人兼CEO趙子豪則更為樂觀,認為這一時刻可能在三年內到來。
盡管時間窗口各有差異,但背后指向同一個趨勢:物理AI正在進入加速階段,這個加速的核心動力不是算力或算法的單一突破,而是數據飛輪真正開始轉動。
*更多精彩對話請前往覓蜂科技公眾號查看智啟具身論壇完整回放
排版運營 / Teagan
- End -
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.