![]()
人形不再獨占C位,大腦內卷,數據為王。
定焦One(dingjiaoone)原創
作者 | 王璐
編輯 | 魏佳
這幾天,科技圈的最大盛事當屬WAIC大會。今年,人氣最旺的是上海世博展覽館H3館,具身智能首次獨立成館,與智算并列為大會兩大核心賽道,從整機到靈巧手、關節模組、傳感器,一條產業鏈完整鋪開。
「定焦One」連續兩天走訪,在現場最直接的感受是“人多”。宇樹展臺被圍得擠不進去,加速進化把展位改成小型足球場,一群不到1米高的機器人自己踢球、搶斷,還會假動作。根據官方披露的信息,今年參展的具身智能企業從去年的80多家增加到200多家,真機超過300臺,且幾乎全部動態運行,而去年這里還以靜態展示為主。
除了觀眾們的熱情之外,還有一個明顯的變化是機器人可以干的事情變了。去年是150臺人形同臺,卷的是后空翻、做咖啡這類炫技動作,今年各家的demo從炫技換成了做早餐、打蝴蝶結、進汽車產線這類更雜、更難也更貼近真實場景的任務,機器人的形態也從單一的人形變得更加豐富。
不過熱鬧之下,行業仍處在早期:大腦架構未定、訓練機器人的數據從哪兒來還是難題。H3館里幾乎每家都在講“我家模型最懂物理世界”,“機器人該用VLA還是世界模型”的爭論被直接搬上論壇。
這些問題沒有標準答案,而WAIC恰好是觀察各家給出什么解法的一個窗口。本文從形態、大腦、落地三個維度切入,看看今年具身智能走到了哪一步。
01.看形態:人形不再是唯一,載人機甲、半人馬也來了
進入H3場館,科幻電影里的場景似乎沒那么遠了。幾臺機器人排成一列緩緩穿過通道,偶爾有觀眾側身讓路,當你餓了的時候,可以去某個展臺“領”一份由機器人完成的早餐,雖然動作還有點僵硬遲緩,但至少是真的能吃。
「定焦One」在館里逛了大半天,一個強烈的感受是,人形機器人依然是重點,但不再獨占C位。去年是150臺人形同臺、卷自由度、卷后空翻,今年人形還在,但載人機甲、可變形本體、半人馬等新形態紛紛涌現,輪式和四足這些成熟形態也找到了更明確的場景。
按落地場景看,各家大致分成了三派。
第一派是工業務實派,既有輪式,也有雙足,形態讓位于穩定。
智元拿下H3館最大展區,集中發布五款產品,其中輪式的精靈G2Max主打“安規級重載”,能24小時不間斷搬運碼垛,無需人工輪崗、夜班值守,直接瞄準倉庫“兩班倒”的人力缺口。
同樣瞄準工業,它石智航給出的是另一套答案,它把一條1:1復刻的汽車線束產線搬進展臺,由“輪式底盤+雙臂”的機器人集群現場演示產線自主作業。工業場景下,這種組合比較務實,能連續作業、能靈活調度,成本和穩定性都適合量產爬坡。
![]()
智元機器人 圖源 / 智元官網
樂聚這屆不再講商超和家庭,轉而聚焦工廠,其全尺寸人形機器人夸父系列(含雙足版與輪式夸父5-W)與螞蟻靈波合作實現物流全場景自動化,涵蓋紙箱拆垛、搬運、上料等環節。
第二派是小人形,把人形機器人做小,用價格換入場券。
松延動力身高不到一米的小布米定價9998元,是目前市面上第一款萬元以內的量產人形機器人,高約94厘米、約12公斤,已正式開售。作為參照,一臺全尺寸人形通常在1.7米上下、幾十萬元起,小布米幾乎把體型和價格同時砍掉一個數量級。展臺上,小布米們同步完成舞蹈,動作對齊精準,OTA3.0功能支持用戶通過手機App遠程更新機器人的交互界面、動作姿態和內容。
消費級小人形的玩家還有鹿明機器人,現場展示了AI迷你雙足人形“鹿小明”,僅89厘米,可跟隨音樂起舞。加速進化則把展臺變成小型足球場,一批身高不到1米的機器人自主踢球、非遙操,射門力道猛還會假動作,走的是科研、競技路線。
![]()
加速進化機器人踢足球 圖源 / 「定焦One」攝
第三派是新形態探索派,按環境切換形態。
宇樹科技依然有人形拳擊賽,但站C位的是GD01,這是一款載人變形機甲,人可以坐進座艙操控,其定位為“民用交通工具”,號稱全球首款量產版載人機甲,但起售價高達390萬元。上緯啟元T1在輪足人形和四足之間自主切換,室內走輪足,安靜、零轉彎半徑,客廳書房都能,到戶外切換四足,過草地、砂石、斜坡、臺階,對應散步、露營場景,其變換形態被網友調侃“人模狗樣”。
逐際動力TRON2走模塊化路線,像拼樂高一樣組合成雙足、雙輪足、雙臂,現場甚至還用雙足加雙臂拼出一只“半人馬”形態,不僅能背負30KG穩步走,還能在地毯上拖輪胎,對應商用服務場景的復雜地形。
![]()
逐際動力半人馬 圖源 / 逐際動力官網
整體看下來,今年機器人的形態比去年更加豐富,但邏輯一致,即按場景反推本體。一位具身智能從業者表示,憑借一款本體打天下的幻覺被訂單砸碎了,“工業要輪式、家庭要人形、消費要小巧、特種要載重機甲,每家都在按場景反推本體,形態自然就被打散了。”
不過,形態變多說明廠商們把場景想清楚了,不代表活兒真干好了。展會上看到的搬運、踢球、舞蹈,多數還是在可控的環境里“演”出來的。選對形態只是拿到了入場券,能不能把活兒干利索,還得看大腦和手腳跟不跟得上。
02.看大腦:VLA之外,世界模型探路
形態是肉眼能看到的變化,更大的比拼發生在看不見的地方——機器人的大腦。
先簡單科普下背景。具身智能這兩年主要用VLA(視覺-語言-動作)模型,它擅長看懂場景、聽懂指令,但對物理世界缺乏真正理解,一遇到沒見過的場景,泛化能力(把學過的本事遷移到新場景的能力)就明顯打折,往往在實驗室里表現很好,一進真實家庭就崩。于是各家開始探索新的方向,“世界模型”成為今年最熱的選項。通俗來說,世界模型是讓機器人先在“腦內”預測“這么做世界會變成什么樣”,再決定動作,而不是死記硬背動作順序。
從現場來看,各家的押注集中在兩個方向:長程任務和復雜操作。
長程任務方面,銀河通用的星腦模型把任務長度從去年的短動作延長到了3–5分鐘。現場演示中,機器人連續完成烤面包、倒飲料、取盤裝盤,即使工作人員臨時挪動杯子或餐盤,它也會重新掃描桌面尋找目標,而不是按固定點位執行。
更為極限的是原力靈機聯合階躍星辰發起的挑戰,6臺機器人用原力靈機的通用具身基礎模型DM0.5,連續協同拼裝一座8萬余塊積木的長城,實現了15小時的持續作業。
復雜操作方面,星塵智能一口氣放出22項真機家庭任務,包括煎蛋顛鍋、稱小米、打蝴蝶結等高難度操作,是本屆WAIC家庭場景demo最全面的一家。
![]()
星塵智能機器人協作疊紙箱 圖源 / 星塵智能官網
在這些能力提升的背后,各家在世界模型上走出了不同解法。
銀河通用在大會期間發布的WAM-TTT,解決的是“進場快”。TTT即“測試時訓練”,可大致理解為,基礎技能先預訓練好,機器人進了客戶現場,只需看一批人類操作視頻,就能適應新環境干活,不需要動作標注,預訓練參數也完全凍結。
按其論文中的對照實驗,100條機器人軌跡搭配100條人類視頻,成功率74.1%,與200條純機器人軌跡的73.7%基本持平,這意味著便宜易得的人類視頻,大致能替代同等數量的真機數據,比如原本需要100小時數據訓練的新任務,現在可能只要2小時就能跑起來。創始人王鶴打了個比方,“廚師換廚房,廚藝不變。”
但一位從業者指出,這一方式想沖到99%的落地標準,仍離不開大量領域專用數據,想“干得好”還要訓練。
星塵智能在WAIC前夜發布的Lumo-2,解答的是“怎么想”。它號稱業界首個“家庭隱式世界動作模型”。
星塵智能副總裁王佳楠用煎蛋的動作,來解釋這條“隱式”路線具體如何工作。模型接到指令后,不會直接調用現成的動作,而是在內部先“想象”一遍,“蛋在鍋中間不好顛,狀態應該變成靠近鍋邊”;再推理動作,“手往下壓一點,讓蛋滑過去”。這和傳統的VLA模型不同,VLA更像是“背動作”,記住以前做過什么,遇到類似情況就照著來,Lumo-2是“為了達到某個效果,自己想辦法生成動作”,所以環境一變,它也能靈活調整。
但該路線也有兩大難點。第一,它不生成畫面,你看不到它腦子里在想什么,就像一臺黑盒子,只能看它最后干得好不好,沒法中途檢查它想得對不對。第二,攝像頭拍到的東西可能不足以區分當前狀況,比如同樣是桌上一只杯子,里面有沒有水、水是滿的還是半滿的,從畫面看幾乎一樣,但機器人該用的動作完全不同。這種隱式路線的優點是省算力、能自主運行、能切換場景,代價是內部過程看不見,出了問題不好排查,訓練也更費勁。
騰訊則在WAIC期間發布了RxBrain,解決的是“推理和想象怎么統一”。它是騰訊Hy-Embodied系列里的“大腦”模型,騰訊首席科學家張正友用“裂腦”比喻來解釋其架構:去年左右腦之間僅通過語言連接,今年RxBrain在左右腦之間增加了視覺信息通道,一邊用文字描述子任務,一邊用圖像展示完成子任務后世界會變成什么樣。
他并沒有直接給這個模型貼上“世界模型”的標簽,但他認為,這已經踩進了世界模型的方向,既能夠做推理,同時有想象力。在他看來,世界模型目前還沒有一個統一的技術方案,各家都在摸索,騰訊也不例外。
把這幾條路線擺在一起,會發現VLA和世界模型并非二選一的關系。VLA在持續進化,世界模型也在吸收VLA的經驗,兩條路線同步往前走。
03.看落地:數據采集和靈巧手成下一輪競爭焦點
在WAIC現場,大家問得最多的問題是:機器人為什么還進不了家、進不了廠?卡點集中在兩處,喂給大腦的數據不夠多,以及執行動作的那只手還不夠靈。
先說數據。世界模型雖然緩解了部分數據壓力,把“理解世界”這部分從遙操轉移到了視頻,但行業才剛起步,各家路線五花八門,無論走哪條路,高質量的真實數據都是繞不開的共同剛需。
![]()
圖源 / 「定焦One」攝
本屆WAIC上,數據采集第一次成了一個獨立品類,多家公司帶著專門的數采設備和方案出現。目前能看到三種思路并存。
第一種是本體廠自采,數據長在自家機器人本體上,宇樹、樂聚都在做,好處是“采什么練什么”,但數據多封閉在自家體系內。
第二種是出售數采設備,相當于“賣鏟子”。
覓蜂科技(智元孵化)的MEgo系列走的就是這條路,核心是“不綁機器人”,用輕便的硬件就能采數據。它的客戶主要是兩類,一類是缺乏本體或不想綁本體的具身初創公司,另一類是本體廠想補一套更靈活的數采手段。
其操作也不需要機器人工程師,普通數據采集員戴上就能開始采集數據。MEgo Gripper是一個手持設備,重量為560克,像拿個加大號游戲手柄,能記錄毫米級的空間軌跡,MEgo View是穿戴套裝,頭上戴全景相機、手腕上綁攝像頭,7路畫面同步錄制,一個人可把“如何操作”的全過程采下來。
第三種是“數采+世界模型”打包賣。大曉機器人在WAIC上同時發布了ACE數采設備和開悟世界模型KAIROS。ACE采回來的數據格式直接和KAIROS對接,客戶不用再轉格式、清洗數據,拿來就能用。當然,也可以只買模型或只買采集設備,不強制捆綁。
三種思路背后是競爭的白熱化,2026年被反復稱作“具身數據元年”,誰把標準化、低成本的數據供給跑通,誰就占住了產業鏈上最難替代的位置。
說完大腦,再來看“手”。如果說數據是“大腦的食物”,那靈巧手就是“大腦的手”,末端不夠靈活,再好的模型也發揮不出作用。
前兩年,行業的目光大多在跑、跳、翻這些大動作上,今年重點從“腿”轉到了“手”。背后也有行業背景,直驅關節的單指成本大幅下降,觸覺傳感的精度和價格雙雙跨過量產臨界點,把靈巧手從過去的工業夾爪,推到了具身智能的核心終端位置。但怎么做一只好手,行業還沒有共識,今年WAIC上,靈巧手的路線也是多種多樣。
靈心巧手一次性把連桿、腱繩、直驅三種技術路線的靈巧手都擺了出來,其中最受關注的O30是全直驅方案,即電機轉子直接連接關節負載,中間沒有任何減速裝置,好處是力控更直接、更精準,代價是電機發熱更大。O30有20個關節獨立活動,重量740克,定位精度亞毫米級,額定負載30公斤,對應汽車精密裝配這類高精度場景。
超維動力的KAIHand追求的是手指靈活度,有37個關節,尺寸和真人手一樣大,指尖力氣超過30牛,整只手80%的面積覆蓋了觸覺皮膚,能感知0.1牛的微小力度。現場還演示了用KAIHand砸木板,證明它既結實又有韌性。
整體來看,今年WAIC的具身智能確實往前走了一大步,本體根據場景劃分成不同形態,任務時長從秒級拉到分鐘甚至小時級;操作也從簡單抓取,升級為復雜的打結、進產線,各家都在從“能演”轉向“能干”。
不過,這個行業還處在探索期。正如現場一位具身智能創業者對「定焦One」感嘆,今年技能層面的進化并沒有超過他的想象,真正絲滑的還是跳舞、迎賓這類簡單場景;零售、物流、工業離可用還很遠,離家庭服務更遠。
WAIC的熱鬧總會散場,聚光燈之外,具身智能這個新興賽道,還得繼續打拼很多年。
*題圖由「定焦One」拍攝。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.