![]()
智東西
作者 三北
編輯 漠影
2026年初,黃仁勛預言物理AI的“ChatGPT時刻”即將到來。
但機器人要復刻大模型的Scaling Law(規模法則),比想象中難得多。機器人的訓練數據需要從真實世界里獲取,行業長期困在小數據、單任務、反復調參的“手工作坊”階段。
今天,小米剛剛扔出一顆“深水炸彈”——Xiaomi-Robotics-1具身基座模型,試圖改變這一局面。
Xiaomi-Robotics-1基于10萬小時真實世界操作軌跡進行預訓練,再用約1.1萬小時跨本體數據完成后訓練。據悉,這是國內首次在機器人策略模型中,對Scaling Law進行較為完整的系統驗證。
實驗結果顯示,當預訓練數據從2500小時擴大至2萬小時,模型在驗證集上的動作預測損失持續下降;當參數規模從20億提升至50億、100億,動作預測能力同樣穩定改善。機器人在未見過的家庭環境中完成鞋柜收納、書包打包等任務的成功率都隨之提高。
具身智能,正在從依賴單任務數據和經驗調參的1.0時代,邁入由數據、模型規模共同驅動的“工業化”2.0時代。
![]()
▲Xiaomi-Robotics-1落地機器人視頻演示
項目主頁:
https://robotics.xiaomi.com/xiaomi-robotics-1.html
一、10萬小時數據,驗證機器人Scaling Law
機器人行業從來不缺“數據越多越好”的共識,但難點在于數據太貴、太碎。
傳統數據主要來自真機遙操作。操作者需要在真實環境中完成抓取、整理、搬運等任務,還要處理失敗重試與設備維護。這種數據不僅采集慢,而且天然綁定具體機器人本體。換一臺機械臂、換一個相機位置,同一任務的數據分布就會發生變化,難以復用。
Xiaomi-Robotics-1的第一步,是重構數據來源。其10萬小時預訓練數據并非全部來自機器人,而是通過自研UMI(Universal Manipulation Interface)便攜式采集設備,記錄人類在真實環境中的操作軌跡。相比傳統方式,UMI可以進入家庭、辦公室、工業等多種場景,捕捉更豐富的操作行為,從而讓模型學習人如何改變世界狀態。
![]()
▲Xiaomi-Robotics-1使用了10萬小時真實世界操作軌跡
面對10萬小時數據,人工標注顯然不可行。小米構建了一條基于視覺語言模型(VLM)的自動標注流水線:將長軌跡切分為片段,并用視覺語言模型描述狀態變化。模型訓練的目標,是根據視覺和語言條件,生成一段能夠推動場景變化的動作序列,從“模仿動作”轉向“理解狀態變化”。
![]()
▲Xiaomi-Robotics-1驗證了機器人Scaling Law
而這10萬小時數據的威力,在實驗中展現出了教科書級別的規模化收益。
隨著數據規模從2.5K小時增加到20K小時,驗證集動作預測損失持續下降,小規模數據容易過擬合,大規模數據則更穩定;模型規模從2B提升到10B,性能同樣持續提升。更重要的是,這種收益不僅存在于離線指標,也體現在真實機器人任務成功率上。
這條從“數據規模→模型能力→真實任務表現”的鏈路,正是機器人版Scaling Law的核心證據。
按照小米披露,這是國內首次對機器人策略模型Scaling Law進行系統驗證。它意味著,機器人能力的提升,開始擺脫“玄學調參”,走向“堆規模、漲能力”的可預測路徑。
二、獨創雙階段新范式,讓機器人學會“開箱即用”
僅有大規模數據,還不足以解決機器人問題。
更深層的挑戰在于:數據之間不統一,能力難以遷移。UMI數據記錄的是人類操作,而非機器人控制信號;不同機器人之間的動作空間也不一致。如果直接混合訓練,模型既難以統一表達,也無法執行指令。
為此,Xiaomi-Robotics-1采用“預訓練+后訓練”的雙階段范式。
預訓練階段,模型從10萬小時軌跡中學習通用動作表征。它關注的不是具體關節角度,而是更底層的物理規律:如何抓取物體、如何整理空間、如何通過連續動作改變環境狀態。
后訓練階段,則完成兩項關鍵對齊:一是本體對齊,把通用能力映射到真實機器人控制空間;二是指令對齊,讓模型能夠理解自然語言并執行任務。這一階段使用約11000小時跨本體數據,包括移動操作機器人、雙臂機器人數據以及Bridge V2、RT-1、DROID等公開數據集。
![]()
▲Xiaomi-Robotics-1采用雙階段新范式
這種設計的核心在于“分工”:用大規模低成本數據學習通用能力,用高質量真機數據完成落地。類似于大模型先預訓練,再指令微調。
結果是,模型具備了“開箱即用”能力。
在未見過的真實家居環境中,它可以根據自然語言完成鞋柜整理、桌面收納、沙發整理等任務,而無需針對每個場景重新訓練。
![]()
▲Xiaomi-Robotics-1在不熟悉環境中可完成沙發整理
更重要的是,規模效應得以遷移:預訓練數據越多、模型越大,未見場景中的成功率越高。這說明模型學到的是可泛化能力,而非固定動作模板。
![]()
![]()
▲數據更大、模型更大,動作預測更穩定
這種能力還體現在新任務適配上。在復雜操作任務中,模型僅需平均不足10小時數據微調,性能就大幅超過從零訓練的模型。這意味著機器人開發模式正在從“每個任務重新訓練”,轉向“在基座模型上快速適配”。
三、全球榜單“屠榜”,定義基座模型新標準
一個基座模型是否具備統治力,不能只看它在自家花園里的表演,更要看它在全球頂尖實驗室公認的競技場中的表現。
Xiaomi-Robotics-1在多個主流仿真基準上取得領先結果:
在公認極具挑戰性的RoboDojo仿真評測中,Xiaomi-Robotics-1以20.07的平均得分和13.93%的成功率強勢登頂Leaderboard,實現了對前最優方法的“斷檔式”領先,顯著高于此前最優的13.07分和8.80%。
![]()
▲RoboDojo官網Leaderboard截圖(截至7月15日)
在覆蓋數百種真實家庭場景的RoboCasa365基準中,Xiaomi-Robotics-1以57.4%的平均成功率一騎絕塵,大幅刷新了此前由谷歌等團隊保持的46.6%的最佳成績。
![]()
▲RoboCasa365官網Leaderboard截圖(截至7月15日)
在考驗模型舉一反三能力的Composite-Unseen任務劃分中,該模型展現出了驚人的任務組合泛化能力。此外,在RoboCasa和VLABench等權威基準上,Xiaomi-Robotics-1也拿下了全面領先的成績。
這些基準覆蓋物體操作、長程任務和組合泛化等能力,能夠有效檢驗模型是否真正具備通用能力。尤其是在復雜組合任務中,Xiaomi-Robotics-1展現出明顯優勢。
更關鍵的是,這些結果與真實機器人實驗形成一致結論:規模提升帶來的收益,既能提升離線指標,也能遷移到真實環境和新任務中。
這也在重新定義機器人基座模型的標準:不僅要參數大,更要具備規模化訓練、跨本體遷移、自然語言控制和低樣本適配能力。只有同時滿足這些條件,機器人模型才可能成為真正的“基礎設施”。
結語:小米三連發閉環,中國具身智能的“重倉時刻”
7月14日至16日,小米機器人連續三天發布進展:從進廠“實習”的機器人本體,到統一生成模型Xiaomo-Robotics—U0,再到Xiaomi-Robotics-1,逐步構建起“本體—數據—模型”的技術閉環。
具身智能的終局,是軟硬件數據一體化的系統戰。小米此次亮劍,為中國龐大的機器人產業鏈提供了一條清晰、可落地的工業化發展路徑:當數據可以規模化生產,模型可以像流水線一樣迭代升級,具身智能的“ChatGPT時刻”,或許真的不再遙遠。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.