![]()
新智元報(bào)道
![]()
讓機(jī)器人把一只蝦夾起來(lái),再放進(jìn)鍋里。
真正困難的,可能不是認(rèn)出蝦,也不是找到鍋,而是把握夾爪閉合的那個(gè)瞬間:早一點(diǎn),夾爪會(huì)落空;晚一點(diǎn),蝦可能已經(jīng)被推走。夾住之后,機(jī)械臂還要連續(xù)調(diào)整力度、方向和速度。整個(gè)過(guò)程沒有暫停鍵,也不會(huì)等攝像頭拍完「下一幀」再繼續(xù)。
但許多視覺世界模型認(rèn)識(shí)時(shí)間的方式,恰恰來(lái)自這些被攝像頭截取的畫面。它們看到第1幀、第2幀、第3幀,并學(xué)習(xí)如何從一張圖跳到下一張圖。至于兩幀之間發(fā)生了什么、換一種幀率后該如何預(yù)測(cè),甚至某個(gè)關(guān)鍵瞬間缺失后如何還原,模型通常沒有一條可以直接查詢的連續(xù)軌跡。
問題也由此變得具體:
如果機(jī)器人對(duì)世界的理解只存在于一格格畫面里,它要怎樣抓住發(fā)生在兩幀之間的那一瞬間?
來(lái)自清華大學(xué)智能產(chǎn)業(yè)研究院(AIR)與UC Berkeley BAIR的研究團(tuán)隊(duì)提出了ODEWorld——全球首個(gè)連續(xù)時(shí)間具身世界模型。它不再只問「下一幀是什么」,而是直接學(xué)習(xí)世界在每個(gè)時(shí)刻朝什么方向、以多快的速度變化,并由此還原一條隨真實(shí)物理時(shí)間連續(xù)演化的潛空間軌跡。
![]()
論文鏈接:https://arxiv.org/abs/2607.27924
項(xiàng)目主頁(yè):https://dstate.github.io/odeworld_website/
這項(xiàng)工作的關(guān)鍵,并不是單獨(dú)增加了一項(xiàng)「補(bǔ)幀」功能。只要模型掌握的是一條連續(xù)的變化軌跡,就可以在任意時(shí)刻讀取狀態(tài):需要更高幀率時(shí),從軌跡上增加采樣點(diǎn);觀測(cè)缺失時(shí),查詢中間時(shí)刻;需要回看變化來(lái)源時(shí),則沿軌跡反向求解。原本分散的生成能力,因此被統(tǒng)一成了同一個(gè)連續(xù)時(shí)間問題。
團(tuán)隊(duì)將這套預(yù)測(cè)范式稱為Physical-Time Flow,簡(jiǎn)稱PT-Flow;基于PT-Flow構(gòu)建的連續(xù)時(shí)間潛空間世界模型,則被命名為ODEWorld。
![]()
離散預(yù)測(cè)的時(shí)間邊界
設(shè)機(jī)器人在時(shí)刻t的狀態(tài)表征為。傳統(tǒng)離散模型通常學(xué)習(xí)一個(gè)狀態(tài)轉(zhuǎn)移函數(shù):
其中c可以是目標(biāo)圖像或任務(wù)指令。
這種建模方式并非無(wú)效,但它將預(yù)測(cè)能力綁定在預(yù)先設(shè)定的時(shí)間步長(zhǎng)上。訓(xùn)練視頻按照固定頻率采樣,模型學(xué)習(xí)的也是相鄰采樣點(diǎn)之間的跳轉(zhuǎn)。當(dāng)查詢時(shí)刻落在兩個(gè)訓(xùn)練幀之間,或者輸入序列缺少部分觀測(cè)時(shí),離散模型本身并沒有一條顯式的連續(xù)軌跡可供查詢。
PT-Flow改為學(xué)習(xí)潛狀態(tài)關(guān)于真實(shí)物理時(shí)間的導(dǎo)數(shù):
這里的是潛空間速度場(chǎng),輸出當(dāng)前狀態(tài)在下一瞬間的變化方向和速度。給定參考狀態(tài)z0后,未來(lái)狀態(tài)可以通過(guò)常微分方程求解器積分得到:
![]()
![]()
靜動(dòng)態(tài)解耦
為速度場(chǎng)構(gòu)造干凈的潛空間
把視頻變成連續(xù)方程,首先需要找到一個(gè)適合由ODE描述的狀態(tài)空間。
在機(jī)器人視頻中,大量視覺內(nèi)容沒有發(fā)生變化。桌面、墻壁和物體紋理可能連續(xù)數(shù)秒保持靜止,真正推動(dòng)任務(wù)進(jìn)程的只有機(jī)械臂、夾爪、目標(biāo)物體以及接觸關(guān)系。若讓速度網(wǎng)絡(luò)同時(shí)擬合靜態(tài)背景與少量運(yùn)動(dòng)區(qū)域,動(dòng)態(tài)信號(hào)會(huì)被大量零變化或噪聲特征淹沒。
ODEWorld因此沒有直接在像素空間中建立速度場(chǎng)。它首先使用凍結(jié)的DINOv2編碼器,將圖像壓縮為視覺特征;隨后再通過(guò)一組以初始狀態(tài)為條件的動(dòng)態(tài)編碼器與解碼器,提取真正負(fù)責(zé)描述變化的潛變量:
![]()
編碼器和解碼器都能直接看到s0。靜態(tài)場(chǎng)景信息因此可以從參考狀態(tài)中取得,zt沒有必要重復(fù)保存背景,只需概括當(dāng)前狀態(tài)相對(duì)s0發(fā)生了什么變化。
這種解耦帶來(lái)了非常激進(jìn)的壓縮:原始DINO特征大小為16×16×768,而ODEWorld的動(dòng)態(tài)潛變量只使用一個(gè)1×768token。基于這個(gè)單token,速度場(chǎng)只需由一個(gè)輕量的三層MLP參數(shù)化,時(shí)間信息通過(guò)FiLM注入;zt、z0和目標(biāo)條件c則共同決定速度網(wǎng)絡(luò)的輸出。
![]()
直接監(jiān)督「狀態(tài)怎么變」
擁有緊湊潛空間,并不意味著模型一定能學(xué)到穩(wěn)定的連續(xù)動(dòng)力學(xué)。潛空間世界模型長(zhǎng)期面臨的一個(gè)問題是表征坍縮:如果編碼器把不同畫面都映射到相似向量,預(yù)測(cè)器就很容易得到較低損失,但這些向量不再包含足夠的狀態(tài)信息。
ODEWorld的關(guān)鍵設(shè)計(jì),是不只比較預(yù)測(cè)狀態(tài)與目標(biāo)狀態(tài)是否一致,而是直接監(jiān)督潛狀態(tài)的一階時(shí)間導(dǎo)數(shù)。
由于動(dòng)態(tài)編碼器滿足,根據(jù)鏈?zhǔn)椒▌t:
![]()
s0在一次預(yù)測(cè)過(guò)程中保持不變,因此它關(guān)于時(shí)間的導(dǎo)數(shù)為零。訓(xùn)練數(shù)據(jù)雖然只提供離散幀,卻可以利用相鄰特征估算。
再通過(guò)雅可比向量積(Jacobian-vector product,JVP),模型無(wú)需顯式構(gòu)造巨大的雅可比矩陣,就能把視覺特征空間中的變化速度投影到動(dòng)態(tài)潛空間,得到。
速度網(wǎng)絡(luò)的訓(xùn)練目標(biāo)由此寫成:
![]()
其中sg?表示停止梯度,用于穩(wěn)定速度場(chǎng)優(yōu)化。論文中的進(jìn)一步實(shí)驗(yàn)顯示,即使移除停止梯度,模型仍然能夠有效訓(xùn)練,說(shuō)明一階速度約束本身已經(jīng)為潛空間提供了較強(qiáng)的結(jié)構(gòu)性約束。
這與典型JEPA式訓(xùn)練存在明顯區(qū)別。后者通常要求預(yù)測(cè)潛變量接近目標(biāo)編碼器產(chǎn)生的潛變量,并依賴EMA、停止梯度或額外的方差與協(xié)方差約束來(lái)避免坍縮。
ODEWorld則把「狀態(tài)如何沿時(shí)間移動(dòng)」直接寫進(jìn)監(jiān)督目標(biāo):如果所有狀態(tài)都坍縮到相同表示,模型便無(wú)法解釋非零的真實(shí)變化速度。
論文采用RankMe衡量表征的有效秩。在相同采樣協(xié)議下,ODEWorld的768維動(dòng)態(tài)潛變量平均有效秩為425.2;DINOv2 CLS特征為376.1;V-JEPA 2的1024維表征為203.7。
更高的有效秩意味著潛空間保留了更多彼此獨(dú)立的變化維度,也表明單token并不等于信息貧乏。
![]()
Savitzky–Golay濾波
理論上,最簡(jiǎn)單的狀態(tài)速度可以由相鄰幀差分得到:
![]()
但ODEWorld使用的是凍結(jié)的DINOv2圖像編碼器。DINOv2主要為單幀視覺表征設(shè)計(jì),并沒有專門保證連續(xù)視頻中的時(shí)間一致性。即便像素只發(fā)生輕微變化,相鄰幀特征也可能包含高頻抖動(dòng);直接將這些差分當(dāng)作物理速度,會(huì)把視覺編碼噪聲一并交給速度場(chǎng)。
團(tuán)隊(duì)因此使用Savitzky–Golay導(dǎo)數(shù)濾波器估計(jì)。
它在局部窗口內(nèi)進(jìn)行多項(xiàng)式平滑和求導(dǎo),在抑制高頻噪聲的同時(shí),盡量保留接觸、抓取和物體移動(dòng)等關(guān)鍵變化。論文的潛軌跡可視化顯示,ODEWorld生成的軌跡比原始DINO特征以及離散下一步預(yù)測(cè)基線更加平滑,同時(shí)仍保留原特征空間的主要幾何結(jié)構(gòu)。
這也揭示了PT-Flow的一個(gè)重要邊界:模型學(xué)習(xí)的不是已知解析物理方程,而是在數(shù)據(jù)中尋找一個(gè)適合連續(xù)積分、又能保留任務(wù)語(yǔ)義的潛空間動(dòng)力系統(tǒng)。它追求的是可用于未來(lái)預(yù)測(cè)的連續(xù)表征,并不是從視頻中恢復(fù)唯一的真實(shí)控制方程。
一條速度場(chǎng)
統(tǒng)一三類生成能力
完成訓(xùn)練后,未來(lái)預(yù)測(cè)不再依賴重復(fù)調(diào)用固定步長(zhǎng)的下一幀模型,而是使用RK4等現(xiàn)成ODE求解器沿速度場(chǎng)積分。查詢時(shí)間點(diǎn)可以自由選擇,由此自然產(chǎn)生三類能力。
第一是任意時(shí)間分辨率生成。希望動(dòng)作更慢,就在軌跡上查詢更多、更密集的時(shí)刻;希望快速推進(jìn),則減少采樣點(diǎn)。模型無(wú)需為不同播放速度單獨(dú)訓(xùn)練。
![]()
第二是時(shí)間補(bǔ)全。論文將訓(xùn)練序列降采樣到原始幀率的三分之一,ODEWorld仍能查詢訓(xùn)練數(shù)據(jù)未提供的中間時(shí)刻并生成連貫狀態(tài)。這里的「補(bǔ)幀」并非簡(jiǎn)單的像素插值,而是從學(xué)習(xí)到的潛空間動(dòng)力學(xué)軌跡中解碼對(duì)應(yīng)時(shí)刻。
![]()
第三是反向生成。將積分方向反轉(zhuǎn),即令,同一速度場(chǎng)就能生成物理上合理的反向序列。這并不意味著模型能夠還原任意系統(tǒng)唯一、真實(shí)的歷史,也不意味著所有現(xiàn)實(shí)過(guò)程嚴(yán)格可逆;它說(shuō)明模型學(xué)習(xí)到的潛空間流可以在相反方向上進(jìn)行穩(wěn)定數(shù)值積分。
![]()
64幀預(yù)測(cè)更快
長(zhǎng)程畫面也更穩(wěn)定
ODEWorld的效率首先來(lái)自表征空間的壓縮。
它沒有在高維像素或完整視覺特征上反復(fù)預(yù)測(cè),而是將與運(yùn)動(dòng)有關(guān)的信息集中到一個(gè)動(dòng)態(tài)token中,在這個(gè)緊湊潛空間里求解狀態(tài)隨時(shí)間的變化。大量與當(dāng)前運(yùn)動(dòng)無(wú)關(guān)、在相鄰幀中基本保持不變的背景和外觀信息,因此不必在每一步預(yù)測(cè)中重復(fù)計(jì)算。
第二層效率來(lái)自速度場(chǎng)本身。
由于動(dòng)態(tài)狀態(tài)已經(jīng)被壓縮,負(fù)責(zé)描述潛狀態(tài)變化率的網(wǎng)絡(luò)只需要一套三層MLP,而不必依賴龐大的逐幀生成網(wǎng)絡(luò)。ODE求解器先在低維潛空間中完成整條軌跡的積分,只有需要輸出具體畫面時(shí),模型才通過(guò)動(dòng)態(tài)解碼器和圖像解碼器恢復(fù)視覺結(jié)果。
換句話說(shuō),ODEWorld把主要計(jì)算用在「世界如何變化」上,而不是在每個(gè)時(shí)間點(diǎn)重新生成一遍完整世界。
在LIBERO視頻預(yù)測(cè)實(shí)驗(yàn)中,各方法的短時(shí)與長(zhǎng)時(shí)預(yù)測(cè)結(jié)果如下。PSNR衡量預(yù)測(cè)畫面與真實(shí)畫面在像素層面的接近程度,數(shù)值越高越好;LPIPS更關(guān)注人眼感知到的結(jié)構(gòu)與語(yǔ)義差異,數(shù)值越低越好。
![]()
短時(shí)的16幀預(yù)測(cè)中,ODEWorld達(dá)到20.53PSNR和0.109LPIPS;當(dāng)預(yù)測(cè)范圍延長(zhǎng)到64幀后,兩項(xiàng)指標(biāo)仍保持在19.46和0.134,均優(yōu)于LDP與V-JEPA 2。速度上的差距更直觀。
生成64幀時(shí),LDP的延遲為3.953秒,V-JEPA2為0.619秒,而ODEWorld只需0.072秒——約為L(zhǎng)DP的1/55、V-JEPA2的1/8.6。
將動(dòng)態(tài)表示壓縮到單token,并用輕量速度場(chǎng)完成連續(xù)積分,不只是減少了模型內(nèi)部的表示規(guī)模,也確實(shí)轉(zhuǎn)化成了端到端預(yù)測(cè)效率。
從預(yù)測(cè)下一幀
到建模變化本身
ODEWorld最重要的意義,不只是極致壓縮帶來(lái)的性能提示,而是把世界模型的學(xué)習(xí)對(duì)象從「離散狀態(tài)之間的映射」轉(zhuǎn)向「狀態(tài)隨物理時(shí)間的變化率」。
靜動(dòng)態(tài)解耦為連續(xù)動(dòng)力學(xué)清理了表征空間;JVP把離散視頻中的變化速度投影為可監(jiān)督的潛空間導(dǎo)數(shù);單token和輕量速度網(wǎng)絡(luò)則讓ODE積分能夠低成本運(yùn)行。任意時(shí)間采樣、缺幀恢復(fù)和反向生成,由此不再是彼此獨(dú)立的功能,而成為同一條潛空間速度場(chǎng)的不同使用方式。
對(duì)具身智能而言,這種變化或許比「多預(yù)測(cè)幾幀」更值得關(guān)注。機(jī)器人真正需要理解的,并不是靜態(tài)世界由哪些像素組成,而是當(dāng)它接近、接觸并移動(dòng)一個(gè)物體時(shí),世界正在怎樣變化,以及這種變化接下來(lái)會(huì)把它帶到哪里。
當(dāng)世界模型開始直接學(xué)習(xí)這種變化,預(yù)測(cè)未來(lái)才可能從逐幀模仿,進(jìn)一步走向連續(xù)的動(dòng)態(tài)推演。
參考資料:
https://arxiv.org/abs/2607.27924
編輯:LRST
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.