編輯|山輝
如果要讓機(jī)械臂把咖啡機(jī)旁的杯子移到桌上,需要經(jīng)歷哪幾個(gè)步驟?
在模型驅(qū)動(dòng)規(guī)劃中,它需要先生成多條候選動(dòng)作,再交給世界模型預(yù)演,根據(jù)預(yù)演結(jié)果決定如何執(zhí)行動(dòng)作。
其中,視頻世界模型通常會(huì)接收當(dāng)前畫面,以及關(guān)節(jié)角、末端位姿、夾爪狀態(tài)等數(shù)值動(dòng)作,生成執(zhí)行動(dòng)作后的未來視頻。
可問題在于,對(duì)視覺模型來說,要建立某組數(shù)字和畫面動(dòng)作之間的對(duì)應(yīng)關(guān)系,需要額外的學(xué)習(xí)。
并且這種學(xué)習(xí)依賴特定機(jī)器人產(chǎn)生的訓(xùn)練數(shù)據(jù),換一臺(tái)機(jī)器人,這些數(shù)據(jù)的結(jié)構(gòu)還會(huì)全部改變。
既然視覺模型更熟悉畫面,為什么不干脆把動(dòng)作也「畫」給它看?
近日,斯坦福大學(xué)、馬里蘭大學(xué)帕克分校和哈佛大學(xué)的研究團(tuán)隊(duì)發(fā)布論文《Masked Visual Actions for Unified World Modeling》。第一作者為 Hadi Alzayer,李飛飛、吳佳俊、張呂敏等研究者參與。
研究團(tuán)隊(duì)提出 Masked Visual Actions,將機(jī)器人的候選動(dòng)作渲染成像素級(jí)運(yùn)動(dòng)軌跡,再讓視頻模型補(bǔ)全環(huán)境的響應(yīng),改變輸入的實(shí)體后,同一個(gè)模型還能在兩個(gè)方向上工作:
- 給出機(jī)器人怎么動(dòng),預(yù)測(cè)環(huán)境會(huì)如何變化;
- 給出目標(biāo)物體怎么動(dòng),生成機(jī)器人可能采取的行為。
![]()
模型微調(diào)用了約 15 小時(shí)的機(jī)器人交互數(shù)據(jù),同一個(gè)模型可以支持正向預(yù)測(cè)、逆向生成、多種機(jī)器人本體、策略評(píng)估和模型規(guī)劃。在 RoboCasa 任務(wù)中,視頻模型輔助規(guī)劃帶來了 7 至 26 個(gè)百分點(diǎn)的成功率提升;模型預(yù)測(cè)的策略表現(xiàn)與真實(shí)仿真結(jié)果達(dá)到 0.982 的相關(guān)系數(shù);逆向動(dòng)作提取管線在 CoffeeServeMug 任務(wù)上取得 90% 的成功率。
![]()
- 論文標(biāo)題:Masked Visual Actions for Unified World Modeling
- 項(xiàng)目主頁(yè):https://masked-visual-actions.github.io/
- 論文鏈接:https://arxiv.org/abs/2607.19343v1
翻譯成視頻就容易看懂了
視頻世界模型直接預(yù)測(cè)未來圖像或視頻,常見工作方式可以概括為:當(dāng)前圖像+數(shù)值動(dòng)作序列 → 未來視頻。
數(shù)值動(dòng)作能夠精確控制機(jī)器人,卻與視頻模型熟悉的像素信息存在表示差異。
從一串動(dòng)作數(shù)據(jù)到最終畫面,中間還隔著多層轉(zhuǎn)換:動(dòng)作數(shù)據(jù) → 機(jī)器人姿態(tài) → 相機(jī)投影 → 畫面運(yùn)動(dòng) → 環(huán)境響應(yīng)。
Masked Visual Actions 提前完成了這層轉(zhuǎn)換。
訓(xùn)練數(shù)據(jù)通過兩種方式構(gòu)造。一種是直接從真實(shí)視頻中分割機(jī)械臂,另一種是根據(jù)機(jī)器人狀態(tài)、URDF 模型和相機(jī)參數(shù)渲染其運(yùn)動(dòng)。前者保留真實(shí)視覺信息,后者方便在推理時(shí)自由輸入新的動(dòng)作軌跡。
視頻模型接收初始畫面和這段機(jī)器人軌跡,再補(bǔ)全物體與環(huán)境的變化。
![]()
相比末端執(zhí)行器點(diǎn)或機(jī)器人骨架,完整掩碼還包含機(jī)器人的形狀、占用空間、遮擋關(guān)系和潛在接觸邊界,模型能夠直接「看」到動(dòng)作過程。
![]()
這種表示也帶來了更好的跨機(jī)器人本體泛化能力。
在 DROID 訓(xùn)練分布內(nèi),完整掩碼、末端執(zhí)行器位置和機(jī)器人骨架都能較好地控制視頻生成,差距并不明顯。
![]()
在訓(xùn)練分布內(nèi)三種視覺條件表現(xiàn)接近
但當(dāng)測(cè)試對(duì)象換成訓(xùn)練中未見過的自定義夾爪,或直接換成 BEHAVIOR 中的雙臂機(jī)器人后,差距迅速拉開。
![]()
換成雙臂機(jī)器人后,完整像素掩碼對(duì)機(jī)器人形態(tài)的保持明顯更穩(wěn)定。
末端點(diǎn)和骨架只提供稀疏的運(yùn)動(dòng)信息,模型容易將新機(jī)器人改寫成訓(xùn)練時(shí)見過的形態(tài),甚至憑空生成另一臺(tái)機(jī)器人;直接接收原始動(dòng)作狀態(tài)的 Ctrl-World,在雙臂機(jī)器人上也容易生成靜止或損壞的畫面。
Masked Visual Actions 則直接給出新本體的完整輪廓與運(yùn)動(dòng),因此能夠較穩(wěn)定地保留機(jī)器人形態(tài),并繼續(xù)預(yù)測(cè)它與環(huán)境的交互。
換句話說,不同機(jī)器人的關(guān)節(jié)數(shù)量、動(dòng)作維度和控制方式可以完全不同,但進(jìn)入視頻模型后,都被轉(zhuǎn)換成了同一種信息,這讓跨機(jī)器人本體泛化成為可能。
兩種填空方式,零樣本切換逆向建模
在此之前,已經(jīng)有一些嘗試證明了「把 URDF 機(jī)器人渲染成掩碼并用作視頻模型條件」這一思路的可行性,
例如,BridgeV2W 將機(jī)器人動(dòng)作渲染成像素對(duì)齊的本體掩碼,再注入預(yù)訓(xùn)練視頻模型。這種表示能縮小動(dòng)作坐標(biāo)空間與視頻像素空間之間的差距,并支持不同機(jī)器人本體。
與之相比,Masked Visual Actions 把問題進(jìn)一步抽象為:一段交互視頻中,可以提供任意一部分實(shí)體的運(yùn)動(dòng)參考,再讓模型補(bǔ)全其余實(shí)體。
用填空題類比,BridgeV2W 的題目基本固定為:已知機(jī)器人動(dòng)作,填寫環(huán)境部分。
Masked Visual Actions 則把它概括成:已知交互中的部分實(shí)體,填寫剩余部分。
于是,模型獲得了一種逆向使用方式:希望物體這樣運(yùn)動(dòng),機(jī)器人應(yīng)該怎么動(dòng)?
![]()
實(shí)際上,論文中的模型主要使用機(jī)器人掩碼進(jìn)行正向訓(xùn)練,推理時(shí)卻能直接接收目標(biāo)物體軌跡,零樣本轉(zhuǎn)向逆向建模。作者認(rèn)為,這種能力來自視覺條件與視頻模型內(nèi)部表征之間的對(duì)齊。
在更完整的機(jī)器人系統(tǒng)中,這兩種推理也許可以連續(xù)配合。
機(jī)器人接到 “把杯子放到桌上” 的任務(wù)后,逆向推理先提出可能的動(dòng)作方案,正向模型再預(yù)演這些方案的結(jié)果,系統(tǒng)選擇可靠軌跡并執(zhí)行。完成一小段動(dòng)作后,攝像頭重新觀察場(chǎng)景,再進(jìn)入下一輪規(guī)劃。
更少的數(shù)據(jù),更徹底的接口統(tǒng)一
研究團(tuán)隊(duì)基于 Wan-Fun-Control 2.2 14B 進(jìn)行 LoRA 微調(diào),數(shù)據(jù)來自 DROID 真實(shí)機(jī)器人視頻和 RoboCasa 仿真環(huán)境,包含成功與失敗軌跡。
其中失敗樣本十分關(guān)鍵。世界模型需要學(xué)會(huì)錯(cuò)誤動(dòng)作會(huì)產(chǎn)生什么結(jié)果,否則它可能對(duì)每一條候選軌跡都生成一個(gè)看似成功的未來。
論文中還提到,模型微調(diào)使用了約 15 小時(shí)的機(jī)器人交互數(shù)據(jù)。
附錄顯示,訓(xùn)練數(shù)據(jù)約包括 1000 條 DROID 演示和 4000 條 RoboCasa 樣本。模型使用 8 張 H200 訓(xùn)練約 10000 步,耗時(shí) 4 天。
這套系統(tǒng)依賴 14B 基礎(chǔ)模型和較強(qiáng)硬件,整體并不輕量。
它的數(shù)據(jù)效率主要體現(xiàn)在不需要從頭訓(xùn)練機(jī)器人世界模型,而是通過少量機(jī)器人樣本激活視頻模型已有的運(yùn)動(dòng)、接觸與物體交互知識(shí),并覆蓋了多種能力:
- 預(yù)測(cè)機(jī)器人動(dòng)作產(chǎn)生的環(huán)境變化;
- 根據(jù)目標(biāo)物體運(yùn)動(dòng)生成機(jī)器人行為;
- 適應(yīng)訓(xùn)練中未出現(xiàn)的機(jī)器人本體;
- 以及從生成視頻中提取可執(zhí)行行為等。
實(shí)驗(yàn)結(jié)果
實(shí)驗(yàn)中先由 Diffusion Policy 為同一場(chǎng)景采樣多條候選動(dòng)作后,視頻模型生成對(duì)應(yīng)未來,Gemini 3.1 Pro 再?gòu)娜蝿?wù)進(jìn)度、物理真實(shí)性和接觸情況等方面評(píng)價(jià)每段視頻,最后選擇最優(yōu)動(dòng)作執(zhí)行。
模型規(guī)劃
在關(guān)閉微波爐、打開抽屜、打開洗碗機(jī)、關(guān)閉冰箱等任務(wù)中,加入視頻模型規(guī)劃后,成功率獲得了7 至 26 個(gè)百分點(diǎn)的提升。候選數(shù)量增加時(shí),整體表現(xiàn)也隨之提高。
![]()
這相當(dāng)于為機(jī)器人增加推理時(shí)計(jì)算:原有策略負(fù)責(zé)提出方案,視頻模型負(fù)責(zé)預(yù)演,視覺語(yǔ)言模型負(fù)責(zé)篩選。策略參數(shù)保持不變,系統(tǒng)通過比較更多未來提高決策質(zhì)量。
策略評(píng)估
作者將同一套機(jī)器人策略分別放進(jìn) RoboCasa 仿真環(huán)境和視頻世界模型中執(zhí)行。模型生成視頻中的成功率,與真實(shí)仿真結(jié)果達(dá)到0.982的相關(guān)系數(shù)。
![]()
在真實(shí)機(jī)器人實(shí)驗(yàn)中,生成視頻所體現(xiàn)的任務(wù)進(jìn)度與實(shí)際演示也較為接近。模型仍然存在明顯的樂觀傾向,常常想象出比現(xiàn)實(shí)更多的任務(wù)進(jìn)展。因此,它更適合作為策略開發(fā)早期的低成本篩查工具,距離替代仿真器和實(shí)機(jī)測(cè)試還有較大距離。
逆向動(dòng)作提取
在 CoffeeServeMug 任務(wù)中,系統(tǒng)輸入杯子的目標(biāo)運(yùn)動(dòng),視頻模型生成機(jī)械臂完成操作的過程,逆動(dòng)力學(xué)模型再提取可執(zhí)行動(dòng)作。完整管線取得 90% 的成功率,高于論文中對(duì)比的 Diffusion Policy、ACT 和 SmolVLA。
![]()
這里的 90% 來自 “視頻模型+逆動(dòng)力學(xué)模型” 的組合。視頻模型提供行為過程,逆動(dòng)力學(xué)模型負(fù)責(zé)把過程還原為控制數(shù)據(jù)。
總結(jié)
Masked Visual Actions 將機(jī)器人動(dòng)作、環(huán)境響應(yīng)和結(jié)果評(píng)價(jià)放入同一個(gè)視覺空間,并將正向預(yù)測(cè)與逆向生成統(tǒng)一為條件視頻補(bǔ)全。
它也清楚地展示了視頻模型在機(jī)器人系統(tǒng)中的一種分工方式:策略提出動(dòng)作,視頻模型預(yù)演未來,視覺語(yǔ)言模型評(píng)價(jià)結(jié)果,控制器完成實(shí)際執(zhí)行。
現(xiàn)階段,這套方法仍受到基礎(chǔ)視頻模型能力的限制。
模型學(xué)習(xí)的是交互相關(guān)性,缺少嚴(yán)格的因果與物理約束,仍會(huì)出現(xiàn)無接觸運(yùn)動(dòng)、物體瞬移和任務(wù)結(jié)果憑空完成等現(xiàn)象。視頻生成的速度和成本也限制了實(shí)時(shí)閉環(huán)控制。逆向流程還需要額外的逆動(dòng)力學(xué)模型,最終執(zhí)行始終依賴數(shù)值動(dòng)作和底層控制器。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.