![]()
![]()
一腦多形路線落地。
作者|田思奇
編輯|栗子
2026世界人工智能大會(huì)(WAIC)的展館里,兩臺(tái)人形機(jī)器人站在轉(zhuǎn)臺(tái)兩側(cè)。面前的料盒轉(zhuǎn)到指定位置后,它們分別拿起零件,完成插接和裝配。小件處理結(jié)束,機(jī)器人又伸出雙臂,搬起整個(gè)料筐,將它放到身后的貨架上。
不遠(yuǎn)處,另一臺(tái)機(jī)器人接到一份取貨訂單,移動(dòng)到擺滿飲料、零食和玩偶的貨架前。它找到指定商品,小心繞開(kāi)隔板和相鄰貨物,再把東西交到觀眾手里。手機(jī)鏡頭很快圍攏過(guò)來(lái)。
但大家已經(jīng)不太滿足于看機(jī)器人走路、跳舞和翻跟頭了。觀眾開(kāi)始關(guān)心更細(xì)小的瞬間:東西混在一起,它會(huì)不會(huì)認(rèn)錯(cuò)?貨架空間這么窄,它的手伸得進(jìn)去嗎?面對(duì)透明包裝,它到底看見(jiàn)了什么?換一個(gè)此前沒(méi)有出現(xiàn)過(guò)的物品,機(jī)器人還知道該怎么做嗎?
今年的WAIC將具身智能與智算并列為兩大核心賽道,超過(guò)200家相關(guān)企業(yè)參展。但討論已經(jīng)不再只圍繞身體展開(kāi)。具身大腦、世界模型、機(jī)器人視覺(jué)、靈巧手和場(chǎng)景應(yīng)用,開(kāi)始和本體一起成為高頻詞。
工信部與國(guó)資委提出,到2026年底,我國(guó)將打造百個(gè)以上高價(jià)值應(yīng)用場(chǎng)景,形成萬(wàn)臺(tái)級(jí)機(jī)器人規(guī)模化落地能力。毫無(wú)疑問(wèn),機(jī)器人正在加快進(jìn)入工廠、商店,家庭等更多真實(shí)空間。但當(dāng)它真正來(lái)到人類生活和工作的環(huán)境中,身體反而未必會(huì)走向統(tǒng)一。
智能層呈現(xiàn)出另一種趨勢(shì)。無(wú)論機(jī)器人擁有什么身體,它都需要看懂環(huán)境、認(rèn)識(shí)物體、理解任務(wù)和規(guī)劃動(dòng)作。這些能力不必隨著本體變化重新開(kāi)始,而可以在不同機(jī)器人、物體和任務(wù)之間積累與遷移。
「甲子光年」認(rèn)為,具身智能的通用性,未必首先表現(xiàn)為一臺(tái)什么都會(huì)的萬(wàn)能機(jī)器人。更現(xiàn)實(shí)的起點(diǎn)可能是,機(jī)器人可以面對(duì)不同的物體和任務(wù),也可以擁有不同的身體和末端執(zhí)行器,但背后始終有一套相對(duì)通用的智能能力,幫助它理解環(huán)境、作出判斷并完成行動(dòng)。
梅卡曼德試圖回答的,正是這套智能能力如何跨越物體、任務(wù)、末端執(zhí)行器和機(jī)器人本體,在不斷變化的真實(shí)場(chǎng)景中延續(xù)下來(lái)。
1.一腦多形,打開(kāi)機(jī)器人的能力邊界
梅卡曼德展臺(tái)上的雙人形機(jī)器人,提供了一個(gè)直觀的觀察入口。中央轉(zhuǎn)臺(tái)不斷送來(lái)不同的料盒和工件,兩臺(tái)機(jī)器人分別完成零件抓取、插接與裝配,隨后又搬起整箱物料,將其放到后方貨架。前一刻還在處理細(xì)小工件,下一刻已經(jīng)轉(zhuǎn)向大幅度搬運(yùn),同一臺(tái)機(jī)器人需要隨著物體和任務(wù)的變化,不斷調(diào)整自己的動(dòng)作。
這里展示的不只是機(jī)器人掌握了多少種動(dòng)作,更重要的是,當(dāng)任務(wù)發(fā)生變化,它是否還能繼續(xù)完成工作。過(guò)去,機(jī)器人往往擅長(zhǎng)在明確的環(huán)境中重復(fù)固定動(dòng)作;而具身智能可以解決的問(wèn)題,是讓機(jī)器人不再被一道任務(wù)、一類物體或者一種使用方式綁定。
*本視頻為4倍速播放
一腦多形,也建立在這種通用性之上。不同的行業(yè)和場(chǎng)景會(huì)需要不同形態(tài)的機(jī)器人:有些適合固定作業(yè),有些需要在空間中移動(dòng),還有一些要進(jìn)入原本為人設(shè)計(jì)的貨架、柜臺(tái)和生活環(huán)境。機(jī)器人的身體未必會(huì)走向統(tǒng)一,但看懂環(huán)境、認(rèn)識(shí)物體、理解任務(wù)和規(guī)劃行動(dòng)等底層能力,可以在不同形態(tài)之間積累和遷移。
再進(jìn)一步,同一套智能能力也可以適配不同的機(jī)器人形態(tài)。無(wú)論身體如何變化,機(jī)器人都要回答幾個(gè)相似的問(wèn)題:眼前有什么,人希望它做什么,以及怎樣把這件事完成。
在WAIC現(xiàn)場(chǎng)的互動(dòng)演示中,工作人員只說(shuō)了一句:現(xiàn)在外面下雨。
桌面上擺著多種模型玩具和生活用品,任務(wù)早已超出按名稱取物的范圍。機(jī)器人需要結(jié)合日常常識(shí)理解這句話背后的需求,判斷人此時(shí)需要雨傘,再?gòu)幕旌蠑[放的物品中找到傘,遞到對(duì)方手中。
隨后,工作人員要求機(jī)器人把藍(lán)色方塊放在2加3的結(jié)果上。機(jī)器人先算出答案是5,再識(shí)別藍(lán)色方塊和數(shù)字5所在的位置,完成抓取與擺放。一次看似簡(jiǎn)單的動(dòng)作,實(shí)際串聯(lián)了數(shù)學(xué)計(jì)算、顏色識(shí)別和空間操作。
在下一個(gè)指令之前,工作人員替換并增加了部分物品,包括黃色、藍(lán)色兩個(gè)盒子,接著要求機(jī)器人把食草動(dòng)物放進(jìn)盒子里。機(jī)器人首先確認(rèn)了盒子的顏色,再選中唯一符合食草動(dòng)物的“大象”,同時(shí)找到指定顏色的容器,完成了指令。這證明桌面內(nèi)容發(fā)生變化后,它仍能根據(jù)當(dāng)前環(huán)境重新判斷對(duì)象和動(dòng)作。
來(lái)源:梅卡曼德
三項(xiàng)任務(wù)分別涉及常識(shí)推理、邏輯計(jì)算和類別理解。Mech-GPT負(fù)責(zé)理解語(yǔ)言、圖像與任務(wù)意圖,3D視覺(jué)確認(rèn)物體和容器的位置,具身大腦進(jìn)一步規(guī)劃行動(dòng)步驟,最終由手臂和末端執(zhí)行器完成操作。機(jī)器人對(duì)復(fù)雜指令的理解,由此轉(zhuǎn)化為物理空間中的連續(xù)動(dòng)作。
這也是具身智能與傳統(tǒng)人機(jī)交互的重要區(qū)別。AI不僅要聽(tīng)懂人說(shuō)了什么,還要聯(lián)系眼前的環(huán)境,推斷真正的任務(wù)目標(biāo),并通過(guò)身體把理解變成行動(dòng)。
零售取貨進(jìn)一步增加了空間的復(fù)雜性。梅卡曼德人形機(jī)器人接到訂單后移動(dòng)至貨架,在飲料、零食和玩偶等商品中尋找目標(biāo)。貨架內(nèi)部空間有限,商品之間還會(huì)相互遮擋。識(shí)別出目標(biāo)以后,機(jī)器人仍要判斷手臂從什么角度進(jìn)入,如何避開(kāi)隔板和相鄰商品,再帶著貨物安全退出。
*本視頻為2倍速播放
桌面互動(dòng)關(guān)注指令理解,貨架取貨則將移動(dòng)、識(shí)別和操作放進(jìn)同一項(xiàng)任務(wù)。在物理世界中,AI面對(duì)的大多不是彼此孤立的動(dòng)作。機(jī)器人必須理解物體與環(huán)境的空間關(guān)系,也要估計(jì)自己的動(dòng)作會(huì)讓周圍發(fā)生什么變化,世界模型的作用由此顯現(xiàn)。
這種能力也不只屬于零售。無(wú)論進(jìn)入商超、物流、科研、展覽還是家庭服務(wù),機(jī)器人都會(huì)面對(duì)有限的空間、隨機(jī)擺放的物體和不斷變化的需求。真實(shí)世界不會(huì)提前把每一道題寫(xiě)進(jìn)程序里,機(jī)器人需要在新的環(huán)境中重新觀察和行動(dòng)。
具身大腦做出的計(jì)劃,最終還要由手與物體的接觸來(lái)實(shí)現(xiàn)。梅卡曼德本次展示的新一代Mech-Hand多指靈巧手,可以根據(jù)不同任務(wù)完成抓、捏、握、提和插拔等動(dòng)作。世界動(dòng)作模型則負(fù)責(zé)將操作目標(biāo)轉(zhuǎn)化為具體的手部動(dòng)作,讓同一只手能夠處理形狀、尺寸和材質(zhì)差異較大的物體。
![]()
來(lái)源:梅卡曼德
這意味著,通用性和泛化性不僅發(fā)生在任務(wù)和本體之間,也發(fā)生在機(jī)器人與不同物體、不同末端執(zhí)行器之間。機(jī)器人不能只認(rèn)識(shí)更多東西,還要根據(jù)物體的狀態(tài),選擇合適的操作方式。
海量物體分類演示中,臺(tái)面上混合放置著日用品、文具、果蔬、食品和玩具,周圍擺著標(biāo)有不同類別的收納盒。機(jī)器人從雜亂物品中拿起“熊貓”,將它放入動(dòng)物類盒子;隨后依次識(shí)別出零食、水果以及不符合具體類別的“其他”物品。
來(lái)源:梅卡曼德
面對(duì)數(shù)百種物品,逐一預(yù)設(shè)規(guī)則并不現(xiàn)實(shí)。機(jī)器人需要持續(xù)識(shí)別混合物品,結(jié)合常識(shí)判斷類別,再根據(jù)臺(tái)面變化更新結(jié)果。雙臂與靈巧手共同完成抓取和放置,將物體認(rèn)知、任務(wù)決策和動(dòng)作執(zhí)行接成一套完整閉環(huán)。
透明物體帶來(lái)了另一類困難。光線穿過(guò)透明瓶和塑料盒以后會(huì)產(chǎn)生折射與反射,深度信息容易出現(xiàn)空洞。人眼能夠自然看見(jiàn)完整瓶身,機(jī)器人獲得的三維輪廓卻可能并不連續(xù)。
梅卡曼德利用自研AI技術(shù)識(shí)別不同形狀的透明物品,再通過(guò)抓取規(guī)劃與運(yùn)動(dòng)控制計(jì)算操作位置,實(shí)現(xiàn)連續(xù)抓取和穩(wěn)定放置。這里處理的不只是透明瓶,也包括透明塑料盒和包裝等容易讓傳統(tǒng)視覺(jué)失效的對(duì)象。
從商超中的透明包裝,到醫(yī)療環(huán)境中的透明容器,現(xiàn)實(shí)世界里存在大量機(jī)器人不容易看清的物體。透明物體泛化抓取所展示的,不只是一個(gè)特殊視覺(jué)能力,而是機(jī)器人能否在信息并不完整時(shí),仍然理解物體并完成操作。
開(kāi)放場(chǎng)景不斷改變機(jī)器人面對(duì)的物體和任務(wù),而在工業(yè)現(xiàn)場(chǎng),這些能力還要接受速度、精度和穩(wěn)定性的檢驗(yàn)。AI可以擁有復(fù)雜的認(rèn)知和規(guī)劃能力,但進(jìn)入真實(shí)工作環(huán)境后,仍要在有限時(shí)間內(nèi)把動(dòng)作做對(duì)。
在高速小件抓取單元中,工業(yè)機(jī)械臂利用AI決策與規(guī)劃,從無(wú)序料框中自主識(shí)別并抓取五角螺母,單件時(shí)間小于2.4秒。計(jì)時(shí)畫(huà)面將感知、規(guī)劃和運(yùn)動(dòng)執(zhí)行的綜合效率轉(zhuǎn)化成直觀數(shù)字。這套能力已經(jīng)大規(guī)模應(yīng)用于高速上料和精密裝配等場(chǎng)景,機(jī)器人不僅要認(rèn)得準(zhǔn)、抓得穩(wěn),也要跟得上真實(shí)工作節(jié)奏。
鈑金件單元中,機(jī)械臂從料框抓起異形工件,在中央治具上完成對(duì)準(zhǔn)與試裝,隨后將其轉(zhuǎn)移至另一料框。面對(duì)輪廓和姿態(tài)各不相同的工件,機(jī)器人需要不斷調(diào)整抓取方向,并完成從識(shí)別、抓取到裝配定位的連續(xù)操作
線束單元面對(duì)的則是另一種完全不同的物體。線束柔軟、容易形變和擺動(dòng),插接時(shí)既要準(zhǔn)確對(duì)位,也要控制力度。機(jī)器人利用視覺(jué)識(shí)別與AI規(guī)劃從料箱中取出線束,調(diào)整插頭姿態(tài),將其送至工裝位置完成插接和拔出,再進(jìn)行轉(zhuǎn)移與下料。高精度視覺(jué)、自適應(yīng)運(yùn)動(dòng)控制與精細(xì)操作共同實(shí)現(xiàn)亞毫米級(jí)柔順插接,可以廣泛應(yīng)用于3C/半導(dǎo)體/汽車電子等行業(yè)的高精密裝配場(chǎng)景。
來(lái)源:梅卡曼德
從雨傘、玩具和零食,到透明瓶、螺母、鈑金件和線束,八個(gè)展示單元面對(duì)的物體、場(chǎng)景和任務(wù)幾乎完全不同。它們共同檢驗(yàn)的,卻是機(jī)器人能否把已有的感知、理解、規(guī)劃和操作能力帶到新的問(wèn)題中。
所謂通用,并不是讓機(jī)器人用同一個(gè)動(dòng)作解決所有問(wèn)題,而是在環(huán)境、物體、任務(wù)、末端執(zhí)行器和本體發(fā)生變化后,它仍能重新理解眼前的情況,并找到完成任務(wù)的方法。
這正是梅卡曼德眼腦手體系希望建立的能力:機(jī)器人身體可以多樣,應(yīng)用場(chǎng)景可以不斷拓展,而支撐行動(dòng)的底層智能體系能夠持續(xù)積累和復(fù)用。
2.從全球交付到數(shù)據(jù)飛輪,規(guī)模化實(shí)現(xiàn)復(fù)利
「甲子光年」認(rèn)為,具身智能的通用性,不只需要在不同展示單元中得到驗(yàn)證,也要在持續(xù)運(yùn)行的真實(shí)場(chǎng)景中不斷成長(zhǎng)。
實(shí)驗(yàn)室和展臺(tái)可以控制燈光、物體與空間,但真實(shí)世界始終充滿變化。物體可能被遮擋,位置和姿態(tài)并不固定,光線隨時(shí)改變,抓取過(guò)程中也可能出現(xiàn)滑脫和偏移。機(jī)器人遇到的場(chǎng)景越豐富,越能發(fā)現(xiàn)此前沒(méi)有覆蓋的問(wèn)題。
目前,梅卡曼德全球累計(jì)部署超過(guò)27000套產(chǎn)品,出口至近50個(gè)國(guó)家和地區(qū),服務(wù)百余家《財(cái)富》500強(qiáng)企業(yè),覆蓋汽車、新能源、物流、3C電子、家電、金屬加工等數(shù)十個(gè)行業(yè)。
這些持續(xù)運(yùn)行的產(chǎn)品,意味著具身智能正在面對(duì)遠(yuǎn)比實(shí)驗(yàn)室更復(fù)雜的真實(shí)世界。每一次成功執(zhí)行、亦或是抓取偏差或環(huán)境變化,都會(huì)轉(zhuǎn)化為新的案例和數(shù)據(jù),持續(xù)反饋到感知、決策、規(guī)劃和操作能力的迭代之中。
由此形成的,是應(yīng)用、數(shù)據(jù)、模型和能力提升之間的循環(huán)。機(jī)器人進(jìn)入的場(chǎng)景越多,接觸的物體和任務(wù)越豐富,模型能夠積累的經(jīng)驗(yàn)也越多;這些能力再進(jìn)入新的機(jī)器人和應(yīng)用中,幫助它們更快適應(yīng)此前沒(méi)有面對(duì)過(guò)的情況。
這也是數(shù)據(jù)飛輪對(duì)具身智能的意義。它不只是讓機(jī)器人把同一個(gè)任務(wù)做得更熟練,而是持續(xù)擴(kuò)大機(jī)器人能夠理解和處理的物體、場(chǎng)景與任務(wù)范圍。
大規(guī)模部署還需要面對(duì)不同地區(qū)和行業(yè)的差異。梅卡曼德業(yè)務(wù)覆蓋近50個(gè)國(guó)家和地區(qū),并在美國(guó)、日本、韓國(guó)和德國(guó)設(shè)有本地團(tuán)隊(duì)。不同市場(chǎng)使用的機(jī)器人、設(shè)備和應(yīng)用環(huán)境并不完全相同,跨區(qū)域運(yùn)行也在持續(xù)檢驗(yàn)同一套智能能力面對(duì)變化時(shí)的適應(yīng)性。
沿著跨行業(yè)、跨場(chǎng)景和跨區(qū)域的應(yīng)用軌跡,具身智能未來(lái)的發(fā)展方向也逐漸清晰。為了進(jìn)入制造車間、物流倉(cāng)庫(kù)、零售貨架、科研空間和家庭環(huán)境,機(jī)器人的外形和結(jié)構(gòu)還會(huì)繼續(xù)分化。不同身體承擔(dān)不同任務(wù),并不意味著每一類機(jī)器人都需要從頭建立一套智能。相反,感知環(huán)境、理解任務(wù)、規(guī)劃動(dòng)作和操作物體等能力,有機(jī)會(huì)跨越不同的物理形態(tài),沉淀為共享的通用智能底座。
梅卡曼德持續(xù)擴(kuò)展的眼腦手體系,正是機(jī)器人進(jìn)入物理世界所需的一套完整能力:從具身智能大模型、仿生分層機(jī)器人大腦、世界動(dòng)作模型,到多指靈巧手,覆蓋了從感知、理解到規(guī)劃與執(zhí)行的完整閉環(huán)。
它沒(méi)有將具身智能押注在一種單一的機(jī)器人外形上,而是希望通過(guò)統(tǒng)一的技術(shù)體系,讓智能能力適配多樣的機(jī)器人形態(tài),為各類機(jī)器人賦予在復(fù)雜環(huán)境中穩(wěn)定作業(yè)的能力,而這也將成為這場(chǎng)技術(shù)浪潮中更為核心的商業(yè)價(jià)值。
(文中未說(shuō)明圖片及視頻由「甲子光年」拍攝)
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.