![]()
作者 | 華衛(wèi)
具身智能過去兩年始終無法回避的核心矛盾:模型越來越強(qiáng),但機(jī)器人仍然很“笨拙”。真實(shí)部署不是一個固定測試集,機(jī)器人進(jìn)入商店、家庭和工作空間后,會不斷遇到預(yù)訓(xùn)練數(shù)據(jù)沒有覆蓋的新物體、新擺放、新指令偏好和長尾失敗。原因并不復(fù)雜,長期以來,機(jī)器人的絕大多數(shù)能力來自離線訓(xùn)練,而真實(shí)世界卻從未真正進(jìn)入訓(xùn)練閉環(huán)。
最近,羅劍嵐團(tuán)隊拿出了解決方案:把“部署”本身變成訓(xùn)練的一部分。上海創(chuàng)智學(xué)院與智元機(jī)器人聯(lián)合發(fā)布了這套方法名為 LWD(Learning While Deploying),不試圖解決某一個單點(diǎn)技術(shù)問題,直接改寫整個訓(xùn)練范式:讓落地后的機(jī)器人在實(shí)際工作中回流數(shù)據(jù)并反哺訓(xùn)練、更新能力,而不是等著它在數(shù)據(jù)集里一次性“學(xué)夠”。
發(fā)布后不久,上海創(chuàng)智學(xué)院副教授、智元機(jī)器人首席科學(xué)家羅劍嵐向我們詳細(xì)披露了 LWD 這項(xiàng)工作未對外公示的技術(shù)設(shè)計細(xì)節(jié)及這套體系接下來的演進(jìn)方向。
機(jī)器人“邊干邊學(xué)”后
成功率達(dá)到 95%
在傳統(tǒng)路徑中,具身模型通常經(jīng)歷大規(guī)模預(yù)訓(xùn)練、模仿學(xué)習(xí)、再到有限的強(qiáng)化學(xué)習(xí)優(yōu)化,最后進(jìn)入部署驗(yàn)證階段。這個流程的問題在于,部署即為結(jié)束,真實(shí)世界的數(shù)據(jù)包括環(huán)境變化帶來的分布偏移、長尾任務(wù)中的探索過程,以及失敗暴露出的能力邊界并沒有被系統(tǒng)性地吸收進(jìn)下一輪訓(xùn)練。最有價值的那部分經(jīng)驗(yàn),反而被浪費(fèi)掉了。
而 LWD 的核心能力,可以打通這一斷裂。它將機(jī)器人學(xué)習(xí)過程重構(gòu)為一個持續(xù)運(yùn)轉(zhuǎn)的數(shù)據(jù)飛輪:離線強(qiáng)化學(xué)習(xí)預(yù)訓(xùn)練得到初始策略,推送到機(jī)器人集群中執(zhí)行;機(jī)器人在真實(shí)環(huán)境中產(chǎn)生的自主軌跡和人工接管數(shù)據(jù)實(shí)時回流;Learner 在云端進(jìn)行在線強(qiáng)化學(xué)習(xí)更新;再將優(yōu)化后的策略同步回機(jī)器人集群,如此循環(huán)往復(fù)。
在這個框架下,每一臺部署中的機(jī)器人,既是執(zhí)行者,也是數(shù)據(jù)采集節(jié)點(diǎn),真實(shí)世界從“測試集”變成了“主訓(xùn)練場”。部署不再是訓(xùn)練的終點(diǎn),而是機(jī)器人智能持續(xù)提升的起點(diǎn)。
據(jù)介紹,團(tuán)隊在 16 臺雙臂機(jī)器人組成的真實(shí)集群上,針對商超補(bǔ)貨、泡茶、榨汁、物品收納等 8 個復(fù)雜任務(wù)進(jìn)行了系統(tǒng)測試。這些任務(wù)往往需要持續(xù)數(shù)分鐘的多步驟規(guī)劃和精細(xì)物理操作。評測結(jié)果顯示,搭載新框架的機(jī)器人平均成功率達(dá)到了 95%,顯著優(yōu)于傳統(tǒng)方案。在最棘手的長程任務(wù)中,新框架帶來了最高 17%的成功率提升,而且單次任務(wù)平均操作周期縮短了約 23.75 秒。這意味著機(jī)器人變得更聰明,學(xué)會了自我糾錯和路徑優(yōu)化。
在被問及 LWD 的數(shù)據(jù)飛輪要真正轉(zhuǎn)起來的瓶頸時,羅劍嵐直接指向了一個更底層的現(xiàn)實(shí)約束,即大規(guī)模真實(shí)部署背后的經(jīng)濟(jì)問題。“機(jī)器人是一個系統(tǒng)工程,數(shù)據(jù)、基建、算法、機(jī)器人數(shù)量以及人工干預(yù)都重要,但如果只看當(dāng)前階段,最核心的問題還是 cost。只有當(dāng)足夠多的機(jī)器人在真實(shí)場景中持續(xù)干活,積累上萬小時甚至上萬臺規(guī)模的交互數(shù)據(jù),這個飛輪才有機(jī)會真正閉環(huán)運(yùn)轉(zhuǎn)。即使現(xiàn)有算法還不完美,其中大量 incremental improvement 依然可以工作。”
這也意味著,部署本身正在成為新的訓(xùn)練資源。“換句話說,誰能部署更多機(jī)器人、讓更多真實(shí)數(shù)據(jù)持續(xù)回流,誰就更有機(jī)會把數(shù)據(jù)飛輪真正轉(zhuǎn)起來。”羅劍嵐還表示,在 scale up 過程中,還會繼續(xù)遇到數(shù)據(jù)質(zhì)量、基礎(chǔ)設(shè)施和算法層面的新問題。但這些問題是隨著部署規(guī)模擴(kuò)大逐步暴露、逐步解決,而不是在一開始就能完全預(yù)先解決。
部署數(shù)據(jù)全部回流
人工干預(yù)不等同成功示范
羅劍嵐提出的這條路徑,聽起來像是一項(xiàng)順理成章的演進(jìn)。但真正的難點(diǎn)在于,這種從離線到在線的統(tǒng)一訓(xùn)練,需要同時解決分布偏移、獎勵稀疏和數(shù)據(jù)來源的高度異構(gòu)三個問題。
據(jù)羅劍嵐介紹,圍繞這些難點(diǎn),LWD 在技術(shù)設(shè)計上做出了一系列關(guān)鍵選擇,包括讓所有部署數(shù)據(jù)無篩選回流、通過強(qiáng)化學(xué)習(xí)框架統(tǒng)一處理不同來源數(shù)據(jù)、將人工干預(yù)數(shù)據(jù)通過結(jié)果自動打標(biāo)納入同一獎勵體系,以及采用稀疏獎勵來避免 reward hacking 問題。
首先,LWD 是強(qiáng)化學(xué)習(xí)框架,部署后的數(shù)據(jù)會全部回流使用,沒有人工篩選步驟。系統(tǒng)是在線、分布式地把數(shù)據(jù)拿回來訓(xùn)練。但對于人工干預(yù)數(shù)據(jù),處理方式也不是簡單地一律當(dāng)成成功示范,而是自動打標(biāo)的。如果人工干預(yù)后任務(wù)最終成功,就標(biāo)記為 1;如果干預(yù)后仍然失敗,就標(biāo)記為 0。
更重要的一點(diǎn)是,干預(yù)率本身是在下降的。羅劍嵐稱,隨著機(jī)器人自主能力提升、數(shù)據(jù)不斷回流,系統(tǒng)會越來越少依賴人工接管。所以在實(shí)際形態(tài)上,更像是一種混合自治:初期人機(jī)協(xié)作較多,后期逐步過渡到更高自主性。“這一點(diǎn)其實(shí)和自動駕駛的發(fā)展路徑是類似的。”
其次,LWD 獎勵函數(shù)使用的是稀疏獎勵。核心原因是 dense reward 容易帶來 reward hacking。稠密獎勵確實(shí)可能讓模型學(xué)得更快,因?yàn)樗峁┝?shaping 信號;但手寫 reward function 往往很難和真實(shí)物理系統(tǒng)、智能體真正應(yīng)該完成的行為一一對應(yīng)。
羅劍嵐舉的一個典型例子是仿真里用 RL 學(xué)走路:如果獎勵只寫成“重心速度越快越好”,模型可能會找到一種不符合常識的“前進(jìn)方式”,比如把頭放在地上、腿朝上,用奇怪姿態(tài)讓重心快速移動。為了修正這些問題,又要不斷增加腳朝地、頭朝上、姿態(tài)合理等額外項(xiàng),最后 reward function 會變得非常復(fù)雜,而且仍然不一定和真實(shí)目標(biāo)完全一致。
“機(jī)器人操作也是類似的。manipulation 任務(wù)里,很難一次性把所有細(xì)節(jié)獎勵都寫對;只要沒寫對,就可能被模型 hack。因此稀疏獎勵的好處是,它至少能保證最終行為符合預(yù)期:成功就是 1,不成功就是 0。”他也坦言,盡管如此,稀疏獎勵的問題也很明顯:長程任務(wù)中信號很少,backup 不穩(wěn)定,很難把正確信號傳回前面的步驟。LWD 用 distributional value learning 來緩解這個問題,把原本的標(biāo)量價值信號建模成分布,通過備份這個分布來保留更多統(tǒng)計信息。
對于“邊部署邊學(xué)習(xí)”可能帶來的安全性與穩(wěn)定性問題,羅劍嵐也明確表示,在真實(shí)部署中,一定會有額外的安全層。模型不會每時每刻都在變化,更新是有節(jié)奏、有控制的。另外,基礎(chǔ)模型本身成功率就比較高,在線學(xué)習(xí)更多是在這個基礎(chǔ)上做提升,而不是完全不穩(wěn)定的探索。
率先跑通閉環(huán):
最適合的是“middle ground”
當(dāng)“部署也變成訓(xùn)練”這件事成立之后,它改變的就不只是單一算法或系統(tǒng)設(shè)計,而是整個具身智能的技術(shù)路徑與產(chǎn)業(yè)邏輯。
在羅劍嵐看來,這一過程可以參考自動駕駛的發(fā)展。自動駕駛沒有辦法在真實(shí)道路上隨意在線試錯,所以會發(fā)展出世界模型、高保真仿真器和離線評測體系;從產(chǎn)業(yè)鏈看,它也經(jīng)歷了從少量試采車、離線數(shù)據(jù)采集,逐漸轉(zhuǎn)向部署數(shù)據(jù)回流、處理回流數(shù)據(jù)、再訓(xùn)練、再推送模型的迭代過程。
“機(jī)器人如果能形成 LWD 這樣的部署閉環(huán),數(shù)據(jù)鏈路也會從‘先采集、再訓(xùn)練、再部署’的離線管線,轉(zhuǎn)向‘部署中持續(xù)回流數(shù)據(jù),云端持續(xù)訓(xùn)練,再把新模型推回機(jī)器人’的過程。區(qū)別在于,機(jī)器人場景如果允許在線學(xué)習(xí)和試錯,這套在線閉環(huán)的效率可能會更快。”
具體落地上,他認(rèn)為,最適合率先跑通這一閉環(huán)的不會是完全開放的家庭場景,也不是高度結(jié)構(gòu)化的工業(yè)環(huán)境,而是介于兩者之間的“middle ground”,例如商超、藥店和便利店。“這類半結(jié)構(gòu)化場景的 layout 和物品類別有一定規(guī)律,不是完全不可控;但同時又存在豐富變化,對泛化性和性能都有要求。”
“大規(guī)模實(shí)驗(yàn)中,
未來會涌現(xiàn) scaling 現(xiàn)象”
LWD 的核心是,預(yù)訓(xùn)練要和部署結(jié)合,形成預(yù)訓(xùn)練和后訓(xùn)練共同驅(qū)動的部署閉環(huán)。談及 VLA 和世界模型兩條預(yù)訓(xùn)練路線的未來走向,羅劍嵐表示,“如果 VLA 指的是 vision-language-action model,即同時包含視覺、語言和動作,那么它不太可能被世界模型簡單取代。機(jī)器人要做動作,一定需要 vision,也一定需要 action。”
他指出,真正有爭議的更多是 language 是否必要。如果機(jī)器人要在開放世界中完成復(fù)雜操作、長程任務(wù)拆解和類似人的推理,那么 language 是需要的,因?yàn)檎Z言模型是目前實(shí)現(xiàn)這類推理能力最好的工具之一。
“但現(xiàn)在的 VLA 形式不一定會固定下來。比如是不是一定要把 action 當(dāng)成若干 token 接到 VLM 后面、對齊到某個 latent space,這些都不一定。”
羅劍嵐還透露,LWD 是在預(yù)訓(xùn)練模型基礎(chǔ)上做后訓(xùn)練,對數(shù)據(jù)的利用效率很高,即使用的數(shù)據(jù)量不算特別大,也能看到性能提升。隨著后訓(xùn)練時間增加,模型性能會在多個任務(wù)上同時提升。“更大規(guī)模實(shí)驗(yàn)中,未來可能會看到類似 test-time scaling 的現(xiàn)象。”
不過,羅劍嵐也強(qiáng)調(diào)道,機(jī)器人不完全等同于語言模型,語言模型的 scaling 往往可以通過 pretraining loss 和下游 benchmark 建立比較清晰的關(guān)系。機(jī)器人還需要先把問題定義清楚,包括在哪些部署場景、優(yōu)化哪些指標(biāo),才能進(jìn)一步討論 scaling 或涌現(xiàn)。
聲明:本文為 AI 前線原創(chuàng),不代表平臺觀點(diǎn),未經(jīng)許可禁止轉(zhuǎn)載。
會議推薦
企業(yè)級 Agent 落地,繞不開 4 個真實(shí)的工程問題!如何在 Agent 安全性和可用性之間找到平衡點(diǎn)?Agent 需要什么樣的記憶系統(tǒng)才能真正理解上下文?如何通過算法壓榨實(shí)現(xiàn)智力增量與成本控制的極致平衡?多 Agent 協(xié)作,如何做到可觀測、可治理、可控制?6.26-27 AICon 上海站,國內(nèi)頭部公司的 Agent 實(shí)踐,一次說透。
今日薦文
你也「在看」嗎?
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.