![]()
一個(gè)人站在貨架前,戴著一副頭戴設(shè)備,拿起一瓶飲料,觀察標(biāo)簽,再把它放回正確的位置。
幾米之外的大屏上,這個(gè)簡單的動(dòng)作被分解成另一種語言:視線落點(diǎn)、手部軌跡、物體位置、抓取過程,以及任務(wù)是否完成。數(shù)據(jù)隨后進(jìn)入虛擬貨架,機(jī)器人在里面一遍遍練習(xí)。最后,一臺(tái)上千公里外的實(shí)體機(jī)器人伸出手臂,做出同樣的動(dòng)作。
從人類動(dòng)手演示,到機(jī)器學(xué)會(huì)動(dòng)手,看上去只隔著幾塊屏幕。
但機(jī)器人真的“學(xué)會(huì)”了嗎?它換一排貨架、換一種瓶子,甚至只是光線暗了一點(diǎn),還能不能把事情做對?
這是今天具身智能面臨的,最現(xiàn)實(shí)、最根本的問題。
過去一年,VLA、世界模型、世界動(dòng)作模型輪番成為熱門概念,行業(yè)融資不斷,機(jī)器人本體和模型能力也在快速進(jìn)步。很容易產(chǎn)生一種錯(cuò)覺:只要模型再更新幾輪,通用機(jī)器人就會(huì)自然出現(xiàn)。
現(xiàn)實(shí)卻沒有這么簡單。
大語言模型的幸運(yùn),是互聯(lián)網(wǎng)已經(jīng)替它準(zhǔn)備了幾十年的文本、圖片和代碼。具身智能面對的物理世界,卻沒有一套現(xiàn)成的語料庫。網(wǎng)上當(dāng)然有海量視頻,但視頻通常只記錄“發(fā)生了什么”,卻不記錄里面的人為什么這樣做、動(dòng)作是否成功、用了多大力度,以及失敗后如何糾正。
具身智能的發(fā)展,缺少能夠被學(xué)習(xí)、被評測、被證明有效的現(xiàn)實(shí)經(jīng)驗(yàn)。
今年WAIC上,京東展示了一套新解法:先把人類在真實(shí)場景中工作的過程采集下來,再用模型驗(yàn)證這些數(shù)據(jù)是否有用,最后把能力裝回機(jī)器人和智能設(shè)備,在現(xiàn)實(shí)里跑起來,然后繼續(xù)收集數(shù)據(jù),再優(yōu)化模型,再跑……
物理世界,可能才是機(jī)器人最好的老師。
機(jī)器人不是缺舞臺(tái),是缺"班"上
大模型通過學(xué)習(xí)人類書籍、圖片和視頻,獲得了在數(shù)字世界里對話、編程、操作軟件的能力。但要讓AI驅(qū)動(dòng)機(jī)器人,在物理世界里像人一樣做家務(wù)、搬磚、種地,視頻是不夠的。
一段人在貨架前整理飲料的視頻,對人幾乎不需要解釋;對機(jī)器人而言,畫面里卻缺失了大量關(guān)鍵信息:人在找什么,為什么選擇這個(gè)瓶子,手應(yīng)該從哪個(gè)方向接近,抓取力度如何變化,商品最后放到什么位置才算完成任務(wù)。
更麻煩的是,具身智能的訓(xùn)練對數(shù)據(jù)質(zhì)量的要求極高,低質(zhì)量的數(shù)據(jù)甚至還會(huì)讓機(jī)器人“降智”。
京東曾經(jīng)做過一組對照實(shí)驗(yàn):同樣是一萬小時(shí)數(shù)據(jù),一組經(jīng)過較嚴(yán)格的質(zhì)量控制,另一組存在一定瑕疵。結(jié)果并不是“有總比沒有強(qiáng)”。當(dāng)后者繼續(xù)擴(kuò)量,機(jī)器人的任務(wù)準(zhǔn)確率和泛化能力并未同步上升,在一些任務(wù)中甚至出現(xiàn)下降。
比如,模型在訓(xùn)練中見過一種礦泉水瓶,換成尺寸和形狀不同的飲料瓶后,還能否正確抓取?如果數(shù)據(jù)只教會(huì)機(jī)器人復(fù)現(xiàn)一個(gè)固定動(dòng)作,而沒有讓它理解任務(wù)和環(huán)境,數(shù)據(jù)量越大,模型可能只是把錯(cuò)誤學(xué)得更牢。
因此,數(shù)據(jù)標(biāo)準(zhǔn)不能只由采集環(huán)節(jié)決定,必須由模型和真機(jī)結(jié)果反向定義。數(shù)據(jù)采下來以后,需要經(jīng)過軌跡提取、自動(dòng)標(biāo)注、質(zhì)量篩選和結(jié)構(gòu)化處理,再進(jìn)入仿真環(huán)境和模型訓(xùn)練,最后回到實(shí)體機(jī)器人上驗(yàn)證。只有機(jī)器人成功率、泛化能力和任務(wù)理解發(fā)生提升,這批數(shù)據(jù)才算真正產(chǎn)生價(jià)值。
京東正在做的,正是把這幾個(gè)原本分散的環(huán)節(jié)串成一條生產(chǎn)線。
人戴上JoyEgoCam,在零售、物流、家庭、工業(yè)等真實(shí)環(huán)境中完成任務(wù);第一視角視頻被加工成模型能夠消化的數(shù)據(jù);JoyAI-Sim等工具再把人類數(shù)據(jù)、仿真數(shù)據(jù)和真機(jī)數(shù)據(jù)連接起來,供模型訓(xùn)練和評測;最終,機(jī)器人回到貨架、倉庫和其他作業(yè)現(xiàn)場完成任務(wù)。
![]()
京東已開源行業(yè)最大的人類視角數(shù)據(jù)集EgoLive,包含約2000小時(shí)高保真雙目視頻、超過6.5萬段數(shù)據(jù)和346類任務(wù)。同時(shí),京東還在采集手部力學(xué)、導(dǎo)航、全身軌跡等更多類型的數(shù)據(jù),目標(biāo)是生產(chǎn)千萬小時(shí)量級的高質(zhì)量數(shù)據(jù)。
但小時(shí)數(shù)并不是京東在這場競爭里最重要的籌碼。
真正稀缺的,是能夠持續(xù)產(chǎn)生數(shù)據(jù)的現(xiàn)實(shí)任務(wù)。理貨、分揀、搬運(yùn)、維修和家庭服務(wù),不是為了訓(xùn)練機(jī)器人臨時(shí)搭建的攝影棚,而是每天都在發(fā)生、有明確目標(biāo),也有結(jié)果可以檢驗(yàn)的工作。
這也是京東切入具身數(shù)據(jù)的邏輯。它的價(jià)值不在于搭了多少個(gè)數(shù)據(jù)采集中心或者雇了多少數(shù)據(jù)采集員,而在于能不能把一個(gè)持續(xù)運(yùn)轉(zhuǎn)的現(xiàn)實(shí)業(yè)務(wù)體系,改造成具身智能的數(shù)據(jù)生產(chǎn)線。每一次真實(shí)操作,都可能成為新的訓(xùn)練樣本;每一次失敗,也可能暴露模型下一步應(yīng)該補(bǔ)什么課。
今天不少公司都能采購設(shè)備、組織人員拍攝數(shù)據(jù),難的是把采集、處理、訓(xùn)練和驗(yàn)證長期跑下去,并把單小時(shí)成本降到產(chǎn)業(yè)能夠承受的水平。京東披露,其數(shù)據(jù)處理成本已經(jīng)較早期下降十倍以上。這意味著具身數(shù)據(jù)正在從一次性科研項(xiàng)目,逐漸接近可以規(guī)模化生產(chǎn)。
數(shù)據(jù)是沉默的,但能力是會(huì)動(dòng)的
數(shù)據(jù)并不會(huì)自動(dòng)變成機(jī)器人的能力。
人類完成一次補(bǔ)貨任務(wù),只需要憑經(jīng)驗(yàn)判斷商品應(yīng)該放在哪里,伸手、抓取、移動(dòng),再確認(rèn)擺放是否完成。但對模型而言,這個(gè)過程必須被拆解成一系列可以學(xué)習(xí)的問題:它看到了什么,理解了什么,下一步應(yīng)該做什么,又該如何判斷行動(dòng)結(jié)果。
這也是物理AI與聊天機(jī)器人的根本區(qū)別。后者面對的通常是一次提問和一次回答,前者面對的卻是持續(xù)變化的畫面、聲音、空間和人的行為。它不僅要理解世界,還要在正確的時(shí)間作出反應(yīng)。
京東對JoyAI的布局,也因此不是押注某一個(gè)包打天下的模型,而是在搭建一個(gè)不斷擴(kuò)展的能力矩陣。
其中,JoyAI-VL-Interaction負(fù)責(zé)的是持續(xù)感知。它讓模型從處理一張靜態(tài)圖片,進(jìn)化到實(shí)時(shí)觀察環(huán)境,在畫面不斷變化的過程中保持理解和響應(yīng)。JoyAI-RA則更進(jìn)一步,將視覺和語言信息映射到動(dòng)作空間,讓模型嘗試回答“看懂之后應(yīng)該怎么做”。
此次WAIC發(fā)布的JoyAI-Talker和JoyAI-Video-Edit,則補(bǔ)上了這套能力矩陣的另外兩個(gè)維度。
JoyAI-Talker是一款實(shí)時(shí)語音交互模型。與傳統(tǒng)語音助手等待用戶說完一句話再回答不同,它更強(qiáng)調(diào)低延遲、可打斷和連續(xù)交流,同時(shí)加入情緒理解與共情能力。對于進(jìn)入家庭和服務(wù)場景的機(jī)器人來說,能否在嘈雜環(huán)境中聽清人在和誰說話、判斷一句話是在下達(dá)指令還是表達(dá)情緒,本身就是感知現(xiàn)實(shí)的一部分。 JoyAI-Video-Edit是一款流式實(shí)時(shí)視頻編輯模型。它表面上屬于視頻生成與編輯能力,但對物理AI而言,視頻不只是內(nèi)容,也可以成為理解動(dòng)態(tài)環(huán)境、生成訓(xùn)練數(shù)據(jù)和模擬現(xiàn)實(shí)變化的工具。京東探索研究院將這項(xiàng)能力用于具身智能的實(shí)時(shí)視頻交互,以及具身智能訓(xùn)練中的數(shù)據(jù)合成。
可以看出,JoyAI模型矩陣擴(kuò)展的方向,并不是簡單疊加模態(tài)的類型,而是在逐步補(bǔ)齊AI進(jìn)入物理世界所需要的能力——從看見環(huán)境、聽懂語言,到進(jìn)行實(shí)時(shí)交流;從理解空間和任務(wù),到模擬變化、規(guī)劃并輸出動(dòng)作。
這套能力還在不斷進(jìn)化。今天的機(jī)器人或許能完成固定貨架上的抓取,下一步則需要適應(yīng)不同品牌、不同包裝、不同位置的商品;今天的智能終端可以回答問題,下一步則需要理解家庭成員的狀態(tài),并主動(dòng)協(xié)調(diào)設(shè)備完成任務(wù)。
數(shù)據(jù)和模型也由此形成循環(huán)。真實(shí)作業(yè)數(shù)據(jù)進(jìn)入模型訓(xùn)練,模型被部署到機(jī)器人和智能設(shè)備中,在任務(wù)中產(chǎn)生成功、失敗和修正的結(jié)果;這些結(jié)果再被轉(zhuǎn)化為新的訓(xùn)練素材,推動(dòng)模型繼續(xù)迭代。
物理AI不是考高分,是干好活
機(jī)器人最終不能一直生活在數(shù)據(jù)中心和仿真環(huán)境里。
模型是否真的有價(jià)值,要回到物理世界的家庭、工廠、商超、養(yǎng)老院。它不只要識(shí)別指令,還要面對噪聲、多人對話、不同設(shè)備和長周期任務(wù);不只要給出答案,還要把答案變成一次次真實(shí)的、有結(jié)果的行動(dòng)。
訓(xùn)練閉環(huán)只是前半場,物理AI真正的難題,是走出實(shí)驗(yàn)環(huán)境后還能不能被人每天用起來。
在WAIC的另一側(cè),一個(gè)由客廳、書房、廚房和臥室組成的家庭樣板間,呈現(xiàn)了物理AI落地的一種未來。
![]()
這里沒有一臺(tái)全能機(jī)器人包辦所有事情。臺(tái)燈、電視、床墊、茶吧機(jī)、玩具和機(jī)器狗分別保留自己的硬件能力,AI做的,是理解用戶此刻真正想要什么,再把任務(wù)分配給合適的設(shè)備。
一句“今天有點(diǎn)累”,并不對應(yīng)某個(gè)固定開關(guān)。床墊可以結(jié)合人的狀態(tài)調(diào)整支撐,音樂設(shè)備可以播放舒緩內(nèi)容,床邊其他設(shè)備也可能參與響應(yīng)。這個(gè)過程的重點(diǎn),不是設(shè)備聽懂了自然語言,而是交互從“用戶控制機(jī)器”變成“機(jī)器理解意圖”。
這正是京東JoyInside的位置。它不是一個(gè)大模型,也不是包辦傳感器、電機(jī)和底層控制的操作系統(tǒng),更像是一層連接模型、設(shè)備能力和具體場景的AI平臺(tái)。硬件廠商負(fù)責(zé)設(shè)備能做什么,JoyInside負(fù)責(zé)讓設(shè)備聽清、理解、記住,并判斷在什么情況下應(yīng)該調(diào)用這些能力。
這條路線比“給每臺(tái)家電塞一個(gè)聊天機(jī)器人”難得多。
京東的真實(shí)使用數(shù)據(jù)也說明,所謂AI空間還遠(yuǎn)未成熟。目前使用頻率最高的仍是臺(tái)燈、點(diǎn)讀筆、時(shí)間管理器等學(xué)習(xí)設(shè)備,其次是玩具;家居家電雖然占據(jù)了JoyInside接入SKU的大頭,活躍度卻相對較低。
原因并不復(fù)雜。一個(gè)玩具會(huì)聊天,用戶幾分鐘就能感知差異;一張床墊、一臺(tái)電視或一套衛(wèi)浴要真正變得智能,需要AI長期理解人的狀態(tài),還要協(xié)調(diào)多個(gè)設(shè)備。會(huì)說話的單品容易做,懂生活的空間很難做。
但后者恰恰可能擁有更大的價(jià)值。
人每天與床、燈、電視、空調(diào)和廚房設(shè)備相處的時(shí)間,遠(yuǎn)遠(yuǎn)超過與一臺(tái)獨(dú)立機(jī)器人的互動(dòng)時(shí)間。當(dāng)這些終端不再只是被動(dòng)等待命令,而是能夠圍繞人運(yùn)轉(zhuǎn)、協(xié)同,它們實(shí)際上組成了一個(gè)分布式的機(jī)器人:傳感器和執(zhí)行器散落在房間里,模型則負(fù)責(zé)理解、調(diào)度和記憶。
JoyInside目前已經(jīng)與近200個(gè)品牌合作,京東預(yù)計(jì)2026年接入終端超過千萬臺(tái)。這個(gè)數(shù)字的意義,不只在于賣出更多AI硬件,而在于它是否能提供足夠多、足夠復(fù)雜的現(xiàn)實(shí)連接點(diǎn)。
![]()
如果千萬臺(tái)設(shè)備只是各自調(diào)用一次模型,它們?nèi)匀皇欠稚⒌闹悄軉纹罚蝗绻O(shè)備能夠在獲得授權(quán)和保護(hù)隱私的前提下,把真實(shí)交互中的問題、失敗和反饋重新用于產(chǎn)品和模型優(yōu)化,它們才可能成為數(shù)據(jù)飛輪的一部分。
京東說自己要做“全球最大物理世界運(yùn)營中心”,看起來這不是建一座更大的數(shù)據(jù)中心,也不是京東自己制造所有模型和機(jī)器人,而是把數(shù)據(jù)采集、模型訓(xùn)練、終端接入、銷售服務(wù)和真實(shí)反饋連接起來。
京東一端連接商品、用戶和智能設(shè)備,另一端深入倉儲(chǔ)、物流、供應(yīng)鏈、健康和維修現(xiàn)場。這些過去顯得過于“重”的業(yè)務(wù),到了物理AI時(shí)代,反而可能成為最難復(fù)制的訓(xùn)練場和驗(yàn)證場,并成為下一步服務(wù)億萬家庭和生產(chǎn)制造場景的應(yīng)用場的基石。
大模型時(shí)代,企業(yè)爭奪的是互聯(lián)網(wǎng)語料、算力和參數(shù)規(guī)模;具身智能時(shí)代,競爭會(huì)進(jìn)一步延伸到真實(shí)任務(wù)、終端入口和反饋迭代效率體系的比拼。
最后的勝者未必是讓機(jī)器人跳得最好看的公司,而可能是最先把日常工作變成有效數(shù)據(jù),再把數(shù)據(jù)變成穩(wěn)定工作能力的那一個(gè)。
回到開頭的那個(gè)小場景。一個(gè)人拿起飲料,一臺(tái)機(jī)器人隨后學(xué)著整理貨架。真正有價(jià)值的,并不是那只機(jī)械臂完成了一次演示,而是人和機(jī)器之間那條看不見的鏈路:現(xiàn)實(shí)被采集,經(jīng)驗(yàn)被提煉,模型接受檢驗(yàn),能力再回到現(xiàn)實(shí)。
京東給出的并不是標(biāo)準(zhǔn)答案,但至少提供了一種足夠具體的解法:讓真實(shí)世界生產(chǎn)數(shù)據(jù),讓數(shù)據(jù)訓(xùn)練模型,再讓模型回到真實(shí)世界繼續(xù)犯錯(cuò)和成長。
對于仍處在早期的具身智能來說,這種緩慢、笨重,卻能夠閉環(huán)的工作,可能比又一個(gè)漂亮的演示更有價(jià)值。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4876321.html?f=wyxwapp
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.