真正有記憶力的機器人VLA模型,是什么樣子?
先不賣關子了,讓我們直接看幾個看似很簡單的演示。
比如,先蓋住不同顏色方塊后 ,讓機械臂以紅綠藍順序揭開。
![]()
![]()
或者,試試它是否可以精準按下不同次數的按鈕?
![]()
![]()
圖中的機械臂,全部做到了!
看似簡單的能力,其實難倒了業界不少機器人。真正的困難,藏在一個看不見的地方——記憶。
原因就在于,很多機器人根本不記得自己按了幾次。
而上圖演示中這種原生上下文的能力,當前主流基于單幀反應式的VLA是做不到的。
好在,就在剛剛,面壁智能把具身智能的這塊致命短板,補上了!
7月19日,WAIC現場,面壁智能開源了首個具身智能系列模型成果MiniCPM-Robot,包含2個模型:MiniCPM-RobotManip(通用VLA模型)、MiniCPM-RobotTrack(跟蹤導航模型)。
其中的MiniCPM-RobotManip,在專門考慮機器人模型的上下文記憶能力RMBench榜單上,達到53.5分的水平,而美國知名 VLA 模型pi0.5只有10.4。
GitHub鏈接:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face鏈接:
https://huggingface.co/openbmb/MiniCPM-RobotManip
https://huggingface.co/openbmb/MiniCPM-RobotTrack
性能比肩行業頂尖
機器人不會5次按鈕,因為目前的絕大多數VLA模型,都只有「單幀反應」的能力。
現在大部分團隊的做法,是讓機器人只根據眼前的這一幀畫面來決定動作。
這就導致在「按5次按鈕」的任務中,當機器人按完第1次,準備進行下一次推理時,它的大腦是完全空白的。
為什么不給機器人加上「上下文歷史記憶」呢?
答案是,算力根本扛不住。
如果要讓模型記住歷史畫面,計算量會呈指數級爆炸。大部分團隊無法對視覺Token進行高效壓縮。如果強行加上記憶,機器人就會變成「樹懶」,動作開始卡頓。
而這,恰恰是面壁智能的統治區。
在考驗機器人模型上下文記憶的RMBench上,出現戲劇性的一幕:專用明星模型π0.5,慘遭滑鐵盧,得分只有10.4分;而MiniCPM-RoboManip,卻一舉拿下53.5分,直接碾壓。
在LIBERO等傳統主流榜單上,MiniCPM-RobotManip同樣躋身第一梯隊,性能比肩行業頂尖。
![]()
面壁智能到底做對了什么?答案是:「視覺Token的極致壓縮」。
這款1.5B參數規模的VLA模型,繼承了面壁智能在今年5月發布的最新多模態大模型MiniCPM-V 4.6的核心技術優勢。
MiniCPM-V 4.6這款模型開源不到2個月,下載量即突破200w+,在多模態基礎模型社區十分火爆。
![]()
面壁智能學術合伙人、多模態智能首席科學家姚遠
通過極致的視覺壓縮技術,面壁將VLA模型從「算力饑餓」中解放出來,讓機器人在真實物理世界中以更低的成本「跑起來」。
機器人場景下,VLA模型每次推理需處理三路相機畫面(雙腕部+主視角)加文本指令,并輸出動作。若處理過慢,機器人便出現肉眼可見的卡頓,而在物理世界中,這種延遲是致命的。
視覺Token壓縮,本質是做精準的「減法」。不經過處理的多路圖像會生成海量Token,直接拖垮推理速度。高效壓縮能用更少Token承載同等視覺信息,就像高清圖轉高質量JPEG——畫質不減,體積銳減。
數據最直觀:MiniCPM-RobotManip單步決策僅需120ms,而pi0.5需234ms——后者時長幾乎是前者的2倍。
![]()
在處理上下文記憶時,Token的極致壓縮讓MiniCPM-RobotManip計算成本也大幅下降。
無歷史幀輸入的pi0.5,算力固定在5.0 TFLOPS,但代價是放棄了歷史記憶,模型「忘記過去,只管當下」。
而MiniCPM-RobotManip(流式推理+子任務生成):算力從0.1 TFLOPS起步,隨歷史幀增加僅緩慢爬升至1.3 TFLOPS(對應120幀)。即便在60秒、1fps的長期記憶場景下,算力也僅約3.3 TFLOPS,始終低于pi0.5的5.0 TFLOPS。
![]()
因此,它用超低成本,實現了「帶腦子、帶記憶」的高級推理。
這就是為什么,它可以讓機器人連貫地完成「做三明治」,不卡頓、不遺忘,跟人類一樣絲滑。
更妙的是,在處理「上下文記憶」時,它的計算成本幾乎不增加。
MiniCPM-RobotManip通過視覺Token極致壓縮,讓「有記憶」的推理成本和「無記憶」的推理成本基本持平。
拔掉網卡,
這只機器狗還能「死死咬住」你?
在WAIC期間,面壁智能還開源了一個追蹤導航模型——MiniCPM-RobotTrack。
面壁的一個真機demo case演示令人印象深刻:一只宇樹Go2機器狗緊緊跟隨一名指定人員。
接著,工作人員走上典型的無網環境電梯——這幾乎相當于直接拔掉了機器狗身上的網卡,沒有Wi-Fi。
最后,機器狗和工作人員一起做電梯,達到另一個軟網環境:地下車庫。
這是業內首個提供真實本地純無網部署的跟蹤模型,而且開箱即用!并且原生適配宇樹Go2 Edu機器狗。
可以在開放環境下零樣本指令跟隨,并且抗各類人物穿梭干擾,同時可以在無網/弱網環境(電梯/停車場)下流暢跟隨。
這個僅有0.9B參數規模的模型,基于MiniCPM4-0.5B訓練完成,在同類開源模型中性能穩居第一。
在三大典型真實場景維度測試中:它達到以下結果。
STT(單目標追蹤):追蹤率達到89.81。
DT(干擾追蹤,即多目標交叉干擾):追蹤率達到73.38。
AT(模糊追蹤,指令意圖模糊或目標信息不全):追蹤率達到80.35。
它不僅全面碾壓了開源的OpenTrackVLA,甚至在STT和AT任務上,領先了閉源的、動用了四路視覺且經過RL訓練的TrackVLA++ four-view驚人的7.11和16.55個百分點!
![]()
一個0.5B的輕量級單視角模型,憑什么能超越前輩大模型?
秘訣在于面壁智能構建的「自進化數據管線(DAgger)策略」。
他們系統化清洗原始數據,剔除仿真器早期產生的異常軌跡、錯誤動作等臟數據,保障訓練數據質量。
在此基礎上,首次提出面向具身追蹤的DAgger策略:模型先在大規模通用場景上預訓練,再持續部署至仿真與真實環境中交互,主動暴露長尾薄弱場景。
系統自動識別短板,定向采集薄弱數據,經專家策略與規則糾偏后迭代訓練。閉環迭代不斷強化低頻復雜場景,顯著提升模型在動態環境中的追蹤與泛化能力。
只需幾分鐘,一臺剛開箱的宇樹Go2 Edu機器狗,跑上一段面壁的一鍵部署腳本,就能瞬間獲得純視覺、純本地的自然語言指令跟蹤能力,能夠在機器狗原生本地算力條件下穩定達到5+ FPS,端到端響應時延約180毫秒。
這是首次實現基于純視覺方案的本地自主指令追蹤。
當下,已驗證適用于樓宇巡檢、人員陪護、園區安防等結構化環境,證明其可靠性與泛用性。
未來突破,憑借弱網/斷網下的自主決策能力,瞄準災害救援(地震/火災)與特種作業(對抗/偵察)。在這些高風險場景中,180ms的低延遲是決定搜救效率與生存概率的核心生存力。
從模型到推理框架
面壁這兩個模型的推理效率,也得到了推理框架PhyAI的幫助。
推理框架PhyAI是由明體科技(MemBodied)聯合北京郵電大學、北京大學共同研發的端云一體、全棧優化的具身智能模型推理建構。
如果說模型是大腦,推理框架就是讓大腦高效運轉的操作系統。
PhyAI面向VLA(視覺-語言-動作)模型與世界模型(WAM),榨干硬件潛力——
與模型官方倉庫相比,PhyAI在NVIDIA GeForce RTX 5090上運行π0、π0.5和GR00T時,分別實現了約2.85倍、1.82倍和2.28倍加速;GR00T在NVIDIA Thor和RTX PRO 6000上也分別實現約1.40倍和4.31倍加速。
![]()
通過簡潔的API,PhyAI在發布首日即完成了對MiniCPM-Robot的適配支持,并使用CUDA Graph 進行加速,推理幀率從10.20 Hz提升至33.2Hz。
同時,團隊還采取了算子融合的方法,將其在NVIDIA H20上的推理幀率進一步提升至36.77Hz。
此次開源的不僅是模型權重,而是完整的技術棧:模型+推理框架+部署方案。
對于開發者來說,這意味著拿到手就能用,不需要重新搭建復雜的感知、規劃和控制系統。
對行業來說,這意味著具身智能的研發門檻被大幅拉低了。
下半場才開始,
具身智能是AGI終局的必需品
面壁智能為何布局具身智能?
這不是偶然。AI競賽下半場的主題之一,是讓AI擁有身體,進入物理世界。
面壁智能、智譜等紛紛布局具身智能,是行業趨勢。
目前大模型公司都在追求語言層面的通用智能,但物理層面的通用智能才剛剛開始。只有語言層面與物理層面的通用智能同時實現,才能實現真正的AGI。
面壁是一家追求通用人工智能的大模型公司,并選了一條區別于云側的路線:端側。終端包括手機、汽車、機器人等等。所以面壁智能布局具身智能,是情理之中。
在WAIC上,面壁智能還展示了與樂聚機器人、吉利汽車等伙伴的產業落地案例——展廳導覽、園區巡檢、倉儲物流……端側能力在這些場景里不是「加分項」,而是「入場券」。
展館、園區、廠區的很多角落存在信號盲區。為了保證機器人在任何網絡環境下都能穩定干活,恰恰要靠強大的端側模型來兜底。
這是端側AI的獨特價值:隱私安全、低延遲、無網可用。
此外,得益于過去的基礎模型訓練經驗與技術積累,面壁還有獨特的優勢:
追求通用智能,而非專用skill;
多模態技術積累深厚,技術底氣足。
面壁智能堅持以通用智能為起點,讓機器人處理更普適、更流水線、更長程的任務。MiniCPM-RobotManip正是這一理念的產物:先打造通用大腦,再適配多元場景。這與多數具身團隊從特定場景出發、由點及面地打磨專用技能的路徑不同。
具身智能天然依賴視覺、語言等多模態信息的融合,而這面壁有濃厚的多模態技術積累。
自研多模態模型MiniCPM-V/O系列已迭代兩年半,開源下載量突破2500萬;MiniCPM-V 4.6開源不到2個月下載量突破200w,在國內外社區影響力廣泛。
正是這份多模態家底,讓面壁能夠快速切入機器人賽道,用視覺Token極致壓縮解決了機器人的「金魚腦」記憶短板。
這家公司用自己的節奏,走出一條獨特的端側AGI之路。
機器人真正「好用」的關鍵,往往藏在看不見的地方——比如,記得住自己按了幾次按鈕。
看著能優雅做出三明治的機械臂,我們有理由相信:屬于中國機器人的AGI時代,已經開啟。
面壁智能具身智能團隊熱招VLA、世界模型、硬件相關研究及工程崗位,可通過以下二維碼投遞:
文章來源:新智元。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.