金磊 發自 上海
量子位 | 公眾號 QbitAI
一個新的國產VLA模型誕生了,而且只有1.5B。
Size這么小,能好用嗎?
來,話不多說,我們直接看效果:
![]()
視頻地址:
https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw
在上面這個真機演示里,兩只機械臂圍著桌面開始做三明治。它們分工合作,先取面包,再夾起生菜、火腿和雞蛋,一層層疊到一起。
再來看下另一段演示:
![]()
視頻地址:
https://mp.weixin.qq.com/s/TWDuh4NmsamJ52E2A6ZpTw
一只宇樹機器狗收到“跟隨前面的人”這條指令后,開始一路跟在目標身后。
從室外走進辦公樓,再進入電梯、地下停車場,機器狗始終沒有跟丟。就算周圍不斷有人經過,環境和光線也在變化,它還是能認準一開始指定的那個人。
更關鍵的是,這套能力直接跑在機器狗本地!
電梯和地下停車場往往是網絡信號比較差的地方。即使進入弱網甚至無網環境,機器狗依然能繼續識別目標、規劃動作,保持跟隨。
而在這兩段Demo背后,則是面壁智能在WAIC期間正式發布并開源的MiniCPM-Robot系列模型。
目前包含兩個模型:
- MiniCPM-RobotManip:也就是開頭控制機械臂做三明治的通用VLA模型,參數量只有1.5B。
- MiniCPM-RobotTrack:主要負責機器人的跟蹤與導航,讓機器人能夠根據自然語言指令,在動態環境里持續跟住指定目標。
和它們一起出現的,還有開源具身智能推理框架PhyAI,負責讓這些模型更快地適配硬件、跑到真實機器人上。
簡單來說,一個負責讓機器人“動手干活”,一個負責讓機器人“認準人、跟著走”,再配上一套負責高效推理的底座。
![]()
面壁這次端出來的,已經是一套逐漸成形的具身智能組合。
躋身第一梯隊,延遲接近一半
先來看MiniCPM-RobotManip。
雖然參數量只有1.5B,但在LIBERO、Calvin、RoboTwin2等主流VLA評測里,它的整體表現已經進入第一梯隊,與π0.5等模型處在相近水平。
![]()
真正把差距拉開的,是對機器人記憶力的考驗。
很多VLA模型在執行動作時,主要根據當前這一幀畫面做判斷。
比如讓機器人點擊畫面里的第二個按鈕5次。
如果它看不到前面的畫面,也記不住自己已經按過幾次,就很容易按一下便停,或者一直按下去。
MiniCPM-RobotManip會把歷史觀測和此前執行過的動作一起納入判斷。它知道任務已經進行到哪一步,也知道什么時候應該停下來。
在專門考察上下文記憶的RMBench中,π0.5的成績約為10分,接近隨機水平,MiniCPM-RobotManip則達到約53分。
這項能力對真實機器人很重要。
疊衣服、收拾桌面、做三明治,看起來都是日常小事,拆開后卻包含一連串動作。機器人只看眼前,很容易做到一半便“失憶”;能記住此前的狀態,才有機會把長任務完整做完。
除了記得住,機器人還得反應快。
面壁給出的單幀推理對比中,在H100顯卡、bf16精度下,MiniCPM-RobotManip單次決策延遲約為120毫秒,π0.5約為234毫秒,前者接近后者的一半。
這里的“成本減半”,主要是體現在推理延遲和計算量上。
聊天模型多想一秒,用戶通常還能等。機械臂每做一步都停頓一秒,動作馬上就會變得僵硬,整個任務的完成時間也會被拉長。
對VLA來說,能不能在有限算力下快速輸出下一步動作,和榜單分數一樣重要。
MiniCPM-RobotTrack也走了類似的小尺寸模型路線。
它以MiniCPM4-0.5B為基礎,整體參數規模為0.9B,主要測試三種真實場景。
第一種是單目標跟蹤。給它一句明確指令,機器狗持續跟著指定的人。
第二種是多人干擾。周圍幾個人同時移動、交叉甚至交換位置,模型依然要認準最初的目標。
第三種更難,指令本身可能比較模糊。比如只說“跟著穿黑衣服的人”,現場又恰好有多個穿著相近的人,模型需要結合畫面理解人類到底指的是誰。
在沒有進行下游強化學習優化的情況下,MiniCPM-RobotTrack在三類任務上的追蹤率分別達到89.8%、73.4%和80.4%,均取得開源方案中的最優結果。
![]()
相比OpenTrackVLA,三項追蹤率分別提高7.0、14.6和6.5個百分點。
在相同的單視角、純SFT設定下,與閉源模型TrackVLA++相比,它在單目標跟蹤和模糊目標跟蹤上的追蹤率分別高出8.8和17.0個百分點,模糊目標跟蹤的成功率達到58.0%。
參數小,表現卻沒有明顯掉隊。
機器人模型的競爭,也開始從單純拼規模,轉向拼單位算力到底能換來多少能力。
把機器人看到的世界壓縮一下
MiniCPM-RobotManip能把尺寸壓到1.5B,背后離不開面壁過去在多模態模型上的積累。
它基于MiniCPM-V 4.6訓練而來(開源不到2個月,下載量已突破200萬)。
面壁的MiniCPM-V/O系列已經持續迭代兩年多,開源總下載量超過2500萬。過去積累的圖像理解、視頻理解和多模態信息處理能力,如今被進一步搬到了機器人身上。
機器人執行一次動作,需要處理的信息其實很多。
一臺雙臂機器人通常會同時接收三個攝像頭的畫面,包括兩個腕部相機和一個主視角相機,再加上一段文字指令,最后輸出一個可以執行的動作。
而且,這個過程一秒要重復好幾次。
如果每一張圖片都被轉換成大量視覺Token,機器人運行得越久,需要處理的歷史信息就越多,計算量很快就會堆起來。
MiniCPM-RobotManip采用的辦法,是盡量壓縮視覺Token。
桌面紋理、墻面圖案等和當前任務關系不大的信息,不必占用太多Token。模型用更短的數據表示保留關鍵內容,單次推理需要處理的信息量也隨之下降。
信息少了,推理自然更快。對應到機械臂上,就是等待時間更短,動作銜接更順。
視覺Token壓縮還有一個更大的用處,可以幫助機器人以更低成本保留歷史記憶。
常規方法每獲得一張新畫面,都要把此前的歷史重新計算一遍。任務越長,計算量增長得越快。
MiniCPM-RobotManip采用流式計算,前面已經處理過的信息可以繼續復用,新畫面進來后,只需要接著往下計算。
這就有點像看連續劇的感覺了。
普通做法每更新一集,都要從第一集重新看起;流式計算則會記住之前的劇情,直接從最新一集接著看。
機器人因此可以帶著更長的歷史繼續執行任務,同時避免計算量一路暴漲。
1.5B的尺寸,也和機器人的實際運行需求有關。
面壁在將約200毫秒視為機器人操作體驗的一道臨界線。再慢下去,機械臂和機器狗的卡頓感就會明顯增加。
當前多數VLA基礎模型都控制在4B以內。模型繼續做大能帶來多少真實操作收益,行業仍在驗證。
![]()
到了MiniCPM-RobotTrack這里,輕量化的思路又換了一種實現方式。
它把視覺畫面、自然語言指令和機器人的控制決策放進同一個模型里統一處理。
用戶說一句“跟著前面穿黑衣服的人”,模型會直接結合攝像頭畫面理解指令,再把判斷轉換成機器狗的運動控制。
整個過程不需要額外安裝一套目標檢測模塊、一套識別模塊,再接一套跟蹤系統。也不用外接開發板,只靠宇樹Go2 Edu原裝攝像頭和本地算力,就能完成單目標跟蹤、多人干擾跟蹤和模糊目標跟蹤。
不過,真實世界總會出現訓練集里很少見的情況。
目標可能突然從鏡頭前橫穿過去,也可能快速轉彎,被其他人短暫擋住。幾個人同時交叉走動時,機器狗還要避免跟錯人。
這類場景數量少,卻最容易讓模型翻車。所以,面壁為此搭建了一套自進化數據管線。
團隊先對原始數據進行檢查和清洗,把異常軌跡、錯誤動作和無效交互剔除掉。隨后讓模型進入仿真和真實機器人環境,在持續運行中主動暴露自己的薄弱環節。
系統再把這些容易出錯的場景集中收集起來,通過專家策略進行糾偏,放回下一輪訓練。
說得通俗一點,這就像給機器狗準備了一本會自動更新的錯題本。
經過一輪輪閉環訓練,目標橫穿、快速轉向、短時遮擋、多人交叉這些長尾問題,也能不斷得到加強。
模型訓好了,裝到真機上仍然有一道關。
攝像頭采集、畫面編碼、模型推理、動作生成、指令傳輸,任何一個環節慢下來,最終都會反映在機器狗的動作上。
面壁圍繞宇樹Go2的完整運行鏈路做了系統級優化。目前MiniCPM-RobotTrack在機器狗原生本地算力上可以穩定達到5Hz以上,端到端響應延遲約180毫秒。
這次開源的內容也不只有模型權重,還包括環境安裝、模型加載、攝像頭接入、文本指令輸入、控制接口和一鍵啟動腳本。
準備一臺Go2 Edu,就能按照開源流程把模型部署起來。
本地部署的好處,在電梯和停車場的演示里體現得很直接。
機器人不用等待畫面上傳云端,也不用等遠程服務器返回結果。攝像頭數據和用戶指令留在本地,網絡信號變差后,完整功能依然可以繼續運行。
直接拔掉網卡,機器狗照樣能根據攝像頭畫面和文字指令,完成目標識別、持續跟蹤和運動控制。
除了MiniCPM-Robot系列之外,這次還有一項容易被忽略的發布——PhyAI。
![]()
它是一款面向Physical AI的開源推理框架,由明體科技聯合北京郵電大學、北京大學研發。
具身模型想從實驗室跑到真實機器人上,中間還要經過硬件適配、量化、算子優化和部署。
不同VLA、世界模型的結構差異很大。每發布一個新模型,再從頭適配一次,時間和工程成本都不低。
PhyAI想做的,就是把這段路縮短。
在RTX 5090上運行π0、π0.5和GR00T時,PhyAI相較模型官方倉庫分別實現約2.85倍、1.82倍和2.28倍加速。
適配MiniCPMRobot系列模型時,PhyAI先通過CUDA Graph把推理幀率從10.12Hz提高到33.28Hz,再加入為模型定制的融合算子,在NVIDIA H20上進一步提高到36.77Hz。
前面是模型效果,這里解決的是工程效率。
模型能干活,還得盡快跑上硬件,跑得足夠快,才能真正進入更多機器人。
機器人需要又好又便宜的大腦
具身智能行業從來不缺精彩Demo。真正難的是離開展臺之后,機器人還能不能穩定工作。
清華大學人工智能學院助理教授、面壁智能多模態首席科學家姚遠在訪談中也提到:
現階段不少機器人Demo會圍繞單一任務采集大量數據,再進行針對性優化,展示效果并不能完全代表基礎模型的真實進度。面壁更看重模型的基礎性、泛化性和通用性,希望先把數據、Infra和工程鏈路打磨好,讓基礎能力提升后自然覆蓋更多場景。沿著大語言模型的發展經驗,具身智能最終也要走向“先通后專”,先理解物理世界的基本常識,再成為做飯、疊衣服或倉儲作業等具體領域的專家。
展館、園區和工廠里,網絡信號不會一直滿格。機器人還要面對隱私、數據合規、任務失敗和異常恢復等一連串現實問題。
榜單分數再高,走到地下停車場便停擺,落地空間依然有限。
這也是面壁把端側能力放在重要位置的原因。
在與樂聚機器人的合作中,面壁把端側多模態大模型、夸父機器人本體和導航系統組合到了一起,推出展廳導覽Agent和園區巡檢Agent。
展廳導覽機器人在無網環境下,也能基于本地知識庫完成離線講解和自由問答。它可以理解展廳環境和人的指令,規劃導覽路線,同時完成避障。
園區巡檢機器人則可以識別車輛違停、路面異常和公共設施問題。敏感畫面直接在本地處理,數據留在客戶側。
與吉利汽車的合作,則進一步走進了生產倉儲場景。
面壁和吉利共同訓練VLA模型,再通過RoboHarness把VLM、VLA、機器人本體和導航系統接到一起,讓機器人執行倉儲中的長程任務。
RoboHarness可以理解成物理世界里的Agent執行框架。
上層VLM負責規劃任務,VLA和導航系統作為可以調用的工具。框架還會管理長任務的上下文和記憶,遇到失敗時進行重試和恢復。
機器人每完成一次任務,運行數據還會進入可治理的數據閉環,繼續幫助模型進化。
![]()
到這里,面壁此次在WAIC帶來的具身智能路線已經比較清楚了。
- MiniCPM-RobotManip負責操作,讓機械臂理解任務、記住過程,再把事情做完。
- MiniCPM-RobotTrack負責跟蹤導航,讓機器狗在復雜環境里認準目標,斷網也能繼續走。
- PhyAI負責把模型更快地部署到真實硬件上。
再往外,樂聚和吉利的合作開始把模型、本體、導航和具體業務流程接起來。
大語言模型時代,人們習慣用參數量判斷能力。但機器人真正走進物理世界后,參數只是其中一個數字。
它還得反應夠快、記得住、斷網能跑,數據留得下來,遇到意外能夠恢復,成本也要控制在企業愿意長期使用的范圍內。
從這個角度看,1.5B和0.9B的意義,也就不止是“小”。它們更像是在回答一個很現實的問題:
當AI真正長出手腳,除了聰明,還得跑得動、用得起,最后把活干完。
GitHub鏈接:
https://github.com/OpenBMB/MiniCPM-Robot
HuggingFace鏈接:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.