當前人形機器人行業硬件方案趨于收斂,“大腦”訓練成為決勝關鍵,而數據量級和質量直接決定模型泛化能力。一個殘酷的現實是:機器人可用的真實物理交互數據總量僅約50萬小時,不足大語言模型訓練數據的萬分之一。
![]()
據2026年機器人全產業鏈接會披露,GPT-2和GPT-3的訓練數據分別對應約79萬小時和1100萬小時,而要實現可用的具身智能,至少需要1000萬小時的多模態數據。由于當前采集良率僅20%-40%,且多場景、長尾數據等因素疊加,實際需求遠超這一數字——覓蜂已把2030年目標數據采集量定在100億小時。
2025年數據采集需求占人形機器人整體訂單約31%,2026年這一比例預計將突破50%。京東提出兩年內采集1000萬小時真實場景視頻數據,并發動最多60萬人參與采集行動。數據正從研發輔助需求,升級為行業核心生產力。
目前真實數據采集主要有三類路線:真機遙操作、無本體采集和仿真合成。
真機遙操作精度最高,操作員通過VR頭顯同步控制機器人完成動作,產出的數據可直接用于訓練VLA模型。但其成本高昂——特斯拉Optimus數據采集員時薪在25至48美元,且長時間操作容易引發眩暈,廢片率較高。
無本體采集(如UMI和EGO)成本更低。EGO(第一人稱視角)采用輕量化頭戴設備采集人類操作視頻,據斯坦福研究驗證,僅2萬小時異構數據即可讓機器人初步涌現自動化能力——給模型喂2萬小時數據后,再給一段40秒的洗碗視頻,它就能初步學會洗碗。覓蜂科技將EGO采集成本降至傳統真機搖操的三分之一甚至更低。
仿真合成數據成本最低、生成最快,但與真實物理世界存在偏差,難以完全替代真機數據,目前多作為補充方案。
數據采集爆發正帶動四個核心環節擴容:
數采設備供應鏈是當前確定性最強的受益方向。無論采用哪種采集路線,相機(尤其是3D深度相機)、IMU慣性測量單元、觸覺傳感器都是剛需。奧比中光在3D深度相機領域領跑,訂單供不應求;華依科技已與覓蜂科技達成IMU批量供貨合作。
第三方數采服務商憑借數據標注和場景管理經驗獲得頭部訂單。京東、智源等企業自建數采工廠,同時與外部數據公司協同。
仿真平臺方面,英偉達、索辰科技是國內外代表玩家。
垂類應用中,細分場景的專屬數據庫具備稀缺性,有望率先實現商業化落地。
國金證券研報指出,數采爆發有望拉動相機、IMU、觸覺傳感器等高ASP環節規模快速提升,競爭格局清晰、增長空間最大。當前全球數據缺口依然巨大,頭部玩家已經開始布局千萬小時甚至百億小時級別的采集目標,數據設備、服務和傳感器供應鏈都將迎來持續增長。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.