![]()
作者|陳姚戈
生成式世界模型能否真正用于機(jī)器人控制?這是物理 AI 領(lǐng)域備受爭(zhēng)議的話題。
生成式模型的預(yù)測(cè)能力越強(qiáng),模型參數(shù)往往越大,推理延遲也可能越高。而機(jī)器人控制恰恰需要極低延遲的閉環(huán)反饋。
“你不可能要求 WAM 在一個(gè)非常小的體量下達(dá)到很強(qiáng)的智能。但模型體量變大之后,自然很難做到實(shí)時(shí)推理,特別是 50Hz 以下的動(dòng)作推理。”上海交通大學(xué)長(zhǎng)聘教軌助理教授穆堯?qū)?InfoQ 表示,“閉環(huán)頻率過(guò)低,一方面會(huì)導(dǎo)致卡頓,另一方面在重復(fù)定位精度產(chǎn)生誤差時(shí),會(huì)進(jìn)一步拉低任務(wù)成功率。”
有沒(méi)有可能在不犧牲實(shí)時(shí)性的前提下,利用生成式模型的預(yù)測(cè)和理解能力?
最近,上海交通大學(xué) ScaleLab 團(tuán)隊(duì)、上海人工智能實(shí)驗(yàn)室聯(lián)合百度智能云團(tuán)隊(duì),發(fā)布世界動(dòng)作模型 AHA-WAM,致力于解決世界模型用于機(jī)器人控制時(shí)的推理延遲和時(shí)空分辨率錯(cuò)配問(wèn)題。
AHA-WAM 基于雙 DiT 架構(gòu),將系統(tǒng)劃分為兩個(gè)步調(diào)不一致的組件:一個(gè)低頻運(yùn)行的世界規(guī)劃器,負(fù)責(zé)建立長(zhǎng)時(shí)界的潛空間計(jì)劃并提供可復(fù)用的層級(jí)潛上下文;一個(gè)高頻運(yùn)行的動(dòng)作專家,以極高的頻率預(yù)測(cè)短程動(dòng)作塊,通過(guò)查詢規(guī)劃器提供的上下文來(lái)指導(dǎo)執(zhí)行。
為了支持異步架構(gòu)穩(wěn)定運(yùn)行,AHA-WAM 進(jìn)一步引入了三項(xiàng)關(guān)鍵機(jī)制:觀測(cè)引導(dǎo)的上下文路由(OVCR),用于根據(jù)最新視覺(jué)觀測(cè)動(dòng)態(tài)更新已緩存的視頻上下文;視界自適應(yīng)偏移訓(xùn)練(Horizon-Adaptive Offset Training),用于處理世界規(guī)劃器和動(dòng)作執(zhí)行器之間的相位差;滾動(dòng) KV 內(nèi)存(Rolling K/V Memory),用于保存跨刷新周期的歷史信息。這些機(jī)制共同解決了異步之后可能出現(xiàn)的上下文過(guò)時(shí)、對(duì)齊偏差和歷史信息丟失問(wèn)題。
得益于架構(gòu)創(chuàng)新,AHA-WAM 在任務(wù)成功率、推理速度上都取得了領(lǐng)先成績(jī)。
![]()
內(nèi)容來(lái)源:
AHA-WAM: Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
在沒(méi)有機(jī)器人數(shù)據(jù)預(yù)訓(xùn)練的情況下,AHA-WAM 在 RoboTwin 2.0 的 50 個(gè)任務(wù)上達(dá)到 92.80% 平均成功率。在真實(shí)環(huán)境的 AgileX Piper 雙臂平臺(tái)上,AHA-WAM 經(jīng)過(guò) RoboCOIN 子集預(yù)訓(xùn)練和任務(wù)微調(diào)后,在疊毛巾、整理桌面、沖泡豆奶、收納盤子四類任務(wù)上取得 78.33% 平均成功率,優(yōu)于 Fast-WAM 的 68.33% 和 Motus 的 21.67%,接近 π0.5 的 76.67%。
值得注意的是 AHA-WAM 在推理延遲上的進(jìn)步。這里的推理延遲,指系統(tǒng)在閉環(huán)控制中,從獲取最新環(huán)境反饋到輸出下一段動(dòng)作指令所需的端到端耗時(shí)。
![]()
內(nèi)容來(lái)源:
AHA-WAM: Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
標(biāo)準(zhǔn)版 AHA-WAM 的推理延遲為 41.37ms,對(duì)應(yīng)控制頻率為 24.17Hz。經(jīng)過(guò) ODE 蒸餾后的 AHA-WAM-Flash,推理延遲進(jìn)一步降至 17.56ms,對(duì)應(yīng)控制頻率為 56.95Hz。
此前,F(xiàn)ast-WAM 的工作已經(jīng)證明,經(jīng)過(guò)架構(gòu)優(yōu)化的世界動(dòng)作模型可以接近 VLA 的推理延遲水平。Fast-WAM 論文顯示,其推理延遲約為 190ms。
![]()
內(nèi)容來(lái)源:
Fast-WAM: Do World Action Models Need Test-time Future Imagination?
AHA-WAM 將 WAM 的推理延遲從百毫秒級(jí)壓低到幾十毫秒級(jí)。這表明,至少在實(shí)驗(yàn)室環(huán)境下,在保留視頻生成模型預(yù)測(cè)規(guī)劃能力的前提下,WAM 并不必然比 VLA 更慢,甚至可以實(shí)現(xiàn)更低的動(dòng)作更新延遲。
架構(gòu)優(yōu)化之外, AI Infra 工程能力和算力網(wǎng)絡(luò)的支撐同樣重要。AHA-WAM 從訓(xùn)練到部署推理,全程依托百度百舸 AI 計(jì)算平臺(tái)完成。尤其是在推理階段,百度百舸團(tuán)隊(duì)針對(duì)動(dòng)作生成鏈路進(jìn)行了系統(tǒng)工程優(yōu)化,使單步動(dòng)作推理延遲從 415ms 壓縮至約 41ms。
這也是 AHA-WAM 值得進(jìn)一步關(guān)注的原因。
2025 年下半年,InfoQ 在與多家具身智能公司探討世界模型的應(yīng)用時(shí),得到的普遍反饋是世界模型可以用于仿真、推理和規(guī)劃,但很難直接用于控制。原因在于成本太高,推理太慢,難以滿足真實(shí)機(jī)器人對(duì)低延遲閉環(huán)反饋的要求。
進(jìn)入 2026 年上半年,隨著 LingBot-VA、Fast-WAM 等面向動(dòng)作控制優(yōu)化的世界模型陸續(xù)出現(xiàn),這一判斷開(kāi)始松動(dòng)。盡管世界模型用于真實(shí)機(jī)器人控制仍處在早期階段,許多機(jī)器人公司已經(jīng)開(kāi)始在內(nèi)部復(fù)現(xiàn)前沿研究,以便在路線出現(xiàn)突破時(shí)迅速跟上。
對(duì)于仍在觀望生成式世界模型能否真正用于機(jī)器人控制的從業(yè)者來(lái)說(shuō),AHA-WAM 的進(jìn)展無(wú)疑提供了更樂(lè)觀的信號(hào)。
接下來(lái),我們將基于 AHA-WAM 論文以及 InfoQ 對(duì)穆堯團(tuán)隊(duì)的訪談,拆解它的基本原理。
1 異步架構(gòu),解耦世界規(guī)劃與動(dòng)作執(zhí)行
世界動(dòng)作模型,起源于對(duì) VLA 路線的質(zhì)疑:如果機(jī)器人只是從當(dāng)前觀測(cè)直接映射到動(dòng)作,它是否真的理解了物理世界?
VLA 模型已成功將大規(guī)模視覺(jué)語(yǔ)言模型遷移到了機(jī)器人領(lǐng)域,但它們多將當(dāng)前觀測(cè)直接映射到動(dòng)作序列,很難捕捉到復(fù)雜的物理交互規(guī)律。為了實(shí)現(xiàn)更通用的操控能力,模型必須具備“想象”未來(lái)的能力,例如物體會(huì)如何隨動(dòng)作變化、接觸關(guān)系會(huì)如何演化、執(zhí)行誤差會(huì)如何影響下一步控制。
相比之下,WAM 的價(jià)值在于它實(shí)現(xiàn)了動(dòng)作推斷與視覺(jué)動(dòng)力學(xué)建模的深度耦合。它讓模型在學(xué)習(xí)策略的同時(shí),也學(xué)習(xí)環(huán)境如何隨動(dòng)作演化,從而將原本稀疏的動(dòng)作監(jiān)督轉(zhuǎn)化為稠密的物理常識(shí)先驗(yàn)。
今年上半年,LingBot-VA、Fast-WAM 等工作已經(jīng)將 WAM 推向了更適合動(dòng)作控制的形態(tài)。他們普遍采用用更重的視頻分支建模高維視覺(jué)動(dòng)態(tài),用更輕的動(dòng)作專家建模低維動(dòng)作分布。這個(gè)非對(duì)稱設(shè)計(jì)的前提是,動(dòng)作分布通常比視頻分布簡(jiǎn)單,不一定需要和視頻生成同等規(guī)模的模型來(lái)承擔(dān)。
AHA-WAM 繼承了這一非對(duì)稱結(jié)構(gòu)。它的視頻分支使用大規(guī)模預(yù)訓(xùn)練視頻模型 Wan2.2-5B 初始化,用來(lái)引入互聯(lián)網(wǎng)視頻中學(xué)到的視覺(jué)規(guī)律和物理先驗(yàn);動(dòng)作分支則采用緊湊的 DiT 架構(gòu),以降低動(dòng)作生成的推理延遲。
但在穆堯團(tuán)隊(duì)看來(lái),只區(qū)分重視頻基座和輕動(dòng)作專家還不夠。現(xiàn)有 WAM 更深層的問(wèn)題,是視頻預(yù)測(cè)和動(dòng)作執(zhí)行在時(shí)間上的綁定。
許多 WAM 會(huì)把世界預(yù)測(cè)和動(dòng)作生成放在同一個(gè)短時(shí)控制節(jié)奏中。結(jié)果是,視頻分支必須頻繁運(yùn)行,反復(fù)建模相鄰幀之間細(xì)小、連續(xù)、但對(duì)控制增益有限的變化。模型參數(shù)越大,預(yù)測(cè)能力可能越強(qiáng),但每一步控制都被視頻分支拖慢,最終會(huì)影響閉環(huán)頻率。
如何解決模型參數(shù)規(guī)模和控制頻率之間的矛盾?
“異步拆分這個(gè)方案,實(shí)際上是我們分析下來(lái)認(rèn)為最直接的技術(shù)方案。”穆堯在接受 InfoQ 采訪時(shí)表示,“action 的生成要求盡可能實(shí)時(shí);但未來(lái)推演這一塊,由于模型體量大,自然會(huì)帶來(lái)比較大的推理代價(jià)。它天然就會(huì)形成一個(gè)快慢系統(tǒng)。慢與快之間會(huì)產(chǎn)生異步。我們技術(shù)上要解決的核心問(wèn)題,就是在異步情況下,如何讓 video generation 依然很好地指導(dǎo)動(dòng)作生成。”
因此,AHA-WAM 沒(méi)有停留在模型容量上的非對(duì)稱,而是進(jìn)一步引入時(shí)間節(jié)奏上的非對(duì)稱。
具體來(lái)說(shuō),AHA-WAM 基于雙 DiT 架構(gòu),將視頻分支和動(dòng)作分支放在兩個(gè)不同的時(shí)間尺度上運(yùn)行。
視頻分支是低頻世界規(guī)劃器,負(fù)責(zé)長(zhǎng)時(shí)界的潛空間規(guī)劃。在論文設(shè)置中,它的規(guī)劃視界為 64 步。它在后臺(tái)運(yùn)行一次,生成可復(fù)用的規(guī)劃上下文。
動(dòng)作分支則是高頻動(dòng)作專家,負(fù)責(zé)生成短程動(dòng)作塊。在論文設(shè)置中,它的動(dòng)作視界為 16 步。它持續(xù)讀取后臺(tái)生成的規(guī)劃上下文,并結(jié)合最新觀測(cè)和機(jī)器人狀態(tài)輸出動(dòng)作,不需要等待視頻分支每次刷新。
這意味著,AHA-WAM 將昂貴的視頻生成計(jì)算從每一次動(dòng)作更新的關(guān)鍵路徑中移出。視頻模型仍然提供物理先驗(yàn),但不再阻塞高頻控制;動(dòng)作模型仍然保持實(shí)時(shí)執(zhí)行,并持續(xù)利用視頻分支提供的長(zhǎng)時(shí)世界信息。
但僅有異步機(jī)制還不夠。視頻規(guī)劃器低頻運(yùn)行,動(dòng)作專家高頻執(zhí)行,同一組規(guī)劃上下文會(huì)被多個(gè)動(dòng)作塊反復(fù)調(diào)用。隨著機(jī)器人不斷執(zhí)行動(dòng)作,真實(shí)場(chǎng)景已經(jīng)發(fā)生變化,低頻規(guī)劃器提供的上下文可能滯后;同時(shí),動(dòng)作塊與視頻規(guī)劃窗口之間也會(huì)出現(xiàn)相位偏移。
異步的 WAM 還需要一些機(jī)制,讓動(dòng)作專家既能復(fù)用慢速視頻模型產(chǎn)生的長(zhǎng)時(shí)上下文,又能根據(jù)最新觀測(cè)對(duì)這些上下文進(jìn)行輕量修正。
2異步之后,如何讓快慢系統(tǒng)保持對(duì)齊和魯棒性?
在穆堯看來(lái),快慢系統(tǒng)拆分之后,設(shè)計(jì)上的難點(diǎn)集中在一個(gè)問(wèn)題上:如何利用快系統(tǒng)獲得的實(shí)時(shí)觀測(cè),對(duì)慢系統(tǒng)傳來(lái)的舊 K/V 緩存進(jìn)行修正。
“這個(gè)修正必須足夠輕量,才能在高頻控制中持續(xù)運(yùn)行;如果修正本身也變得冗長(zhǎng),異步架構(gòu)的意義就會(huì)被抵消。”穆堯表示。
圍繞這個(gè)問(wèn)題,AHA-WAM 設(shè)計(jì)了三項(xiàng)機(jī)制:OVCR 負(fù)責(zé)用最新觀測(cè)校準(zhǔn)舊上下文;視界自適應(yīng)偏移訓(xùn)練負(fù)責(zé)讓動(dòng)作專家適應(yīng)快慢系統(tǒng)之間的相位差;滾動(dòng) K/V 內(nèi)存負(fù)責(zé)讓低頻視頻規(guī)劃器保留歷史狀態(tài)。三者共同支撐了異步架構(gòu)在高頻控制中的穩(wěn)定運(yùn)行。
觀測(cè)引導(dǎo)的上下文路由 (OVCR, Observation-Guided Video-Context Routing)
在異步推理中,視頻規(guī)劃器運(yùn)行一次后,會(huì)生成一組可復(fù)用的規(guī)劃上下文。動(dòng)作專家會(huì)在多個(gè)后續(xù)動(dòng)作塊中反復(fù)讀取這組上下文。但隨著機(jī)器人執(zhí)行動(dòng)作,物體位置、接觸狀態(tài)和視覺(jué)場(chǎng)景都可能發(fā)生變化。如果動(dòng)作專家直接使用舊上下文,控制就可能基于過(guò)時(shí)信息。
相比將完整的高維視覺(jué)特征直接塞進(jìn)動(dòng)作專家,OVCR 的處理方式是:模型用一組可學(xué)習(xí)的查詢,從最新視覺(jué)觀測(cè)中抽取對(duì)修正舊上下文有用的信息,再對(duì)視頻規(guī)劃器緩存的 K/V 狀態(tài)做殘差更新。經(jīng)過(guò)這一步,原本靜態(tài)復(fù)用的規(guī)劃上下文,會(huì)變成針對(duì)當(dāng)前動(dòng)作塊校準(zhǔn)后的上下文,再交給動(dòng)作專家使用。
這個(gè)設(shè)計(jì)的關(guān)鍵在于,它不需要重新運(yùn)行沉重的視頻 DiT。視頻分支仍然被移出每次動(dòng)作更新的關(guān)鍵路徑,但動(dòng)作專家獲得的規(guī)劃信息,已經(jīng)根據(jù)最新視覺(jué)證據(jù)做過(guò)校準(zhǔn)。OVCR 讓視頻 DiT 保持在每次動(dòng)作更新的關(guān)鍵路徑之外,同時(shí)讓每個(gè)動(dòng)作塊獲得與當(dāng)前視覺(jué)證據(jù)對(duì)齊的規(guī)劃表征。
視界自適應(yīng)偏移訓(xùn)練 (Horizon-Adaptive Offset Training)
在同步模型中,視頻規(guī)劃窗口和動(dòng)作塊通常可以固定對(duì)齊。但異步部署后,視頻規(guī)劃器低頻刷新,動(dòng)作專家高頻執(zhí)行,同一個(gè)規(guī)劃上下文可能被不同時(shí)間點(diǎn)的動(dòng)作塊復(fù)用。此時(shí),動(dòng)作塊相對(duì)于規(guī)劃窗口的起點(diǎn)會(huì)處在不同位置。如果訓(xùn)練時(shí)模型只見(jiàn)過(guò)固定對(duì)齊關(guān)系,部署時(shí)面對(duì)這些中間相位就會(huì)變得脆弱。
AHA-WAM 的做法,是在訓(xùn)練中主動(dòng)制造這種錯(cuò)位。視頻規(guī)劃器負(fù)責(zé)較長(zhǎng)視界,動(dòng)作專家負(fù)責(zé)較短動(dòng)作塊;但訓(xùn)練時(shí),系統(tǒng)會(huì)隨機(jī)移動(dòng)動(dòng)作塊在視頻規(guī)劃視界中的起點(diǎn),讓動(dòng)作專家學(xué)習(xí)在不同相位下讀取和使用同一段長(zhǎng)時(shí)規(guī)劃上下文。
滾動(dòng) K/V 內(nèi)存 (Rolling K/V Memory)
由于視頻 DiT 低頻運(yùn)行,它不能只依賴當(dāng)前觀測(cè)來(lái)生成規(guī)劃上下文。長(zhǎng)程操控任務(wù)中,已經(jīng)完成的子目標(biāo)、被移動(dòng)過(guò)的物體、此前出現(xiàn)但當(dāng)前不在畫(huà)面中心的狀態(tài),都可能影響后續(xù)動(dòng)作。
為此,AHA-WAM 在視頻規(guī)劃器內(nèi)部維護(hù)一個(gè)固定大小的先進(jìn)先出 K/V 記憶庫(kù),保存最近幾次規(guī)劃刷新產(chǎn)生的歷史視頻狀態(tài)。下一次規(guī)劃器刷新時(shí),視頻 DiT 會(huì)讀取這些歷史 K/V,再生成新的規(guī)劃上下文。
需要注意的是,這個(gè)記憶不是動(dòng)作專家直接讀取的外部記憶。它屬于慢速視頻規(guī)劃器內(nèi)部,用來(lái)擴(kuò)展規(guī)劃器對(duì)過(guò)去觀測(cè)的時(shí)間感受野。動(dòng)作專家真正消費(fèi)的,仍然是經(jīng)過(guò) OVCR 校準(zhǔn)后的規(guī)劃上下文。這樣,AHA-WAM 同時(shí)保留了長(zhǎng)程歷史和實(shí)時(shí)反饋:慢系統(tǒng)記住過(guò)去,快系統(tǒng)對(duì)齊當(dāng)前。
消融實(shí)驗(yàn)也驗(yàn)證了這些機(jī)制的必要性。
![]()
內(nèi)容來(lái)源:
AHA-WAM: Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing
AHA-WAM 設(shè)置了一個(gè)簡(jiǎn)化版本 Naive-Async,雖然實(shí)現(xiàn)了視頻分支和動(dòng)作分支的異步拆分,單去除了 OVCR 和滾動(dòng) K/V 內(nèi)存這兩項(xiàng)關(guān)鍵增強(qiáng)技術(shù)。
實(shí)驗(yàn)顯示,Naive-Async 的平均成功率為 88.60%,低于 Fast-WAM 的 91.83%。加入滾動(dòng) K/V 內(nèi)存后,平均成功率提升到 91.01%;加入 OVCR 后進(jìn)一步提升到 91.47%;完整 AHA-WAM 達(dá)到 92.80%。
這說(shuō)明,異步拆分只是 AHA-WAM 的第一步。真正實(shí)現(xiàn)高頻控制的,是 OVCR、視界自適應(yīng)偏移訓(xùn)練和滾動(dòng) K/V 內(nèi)存共同完成的快慢系統(tǒng)對(duì)齊。沒(méi)有這層橋接,更快的動(dòng)作更新并不會(huì)自然帶來(lái)更好的控制效果。
3 結(jié)語(yǔ)
AHA-WAM 的研究也說(shuō)明,生成式世界模型進(jìn)入機(jī)器人控制閉環(huán),不只是算法結(jié)構(gòu)問(wèn)題,也依賴訓(xùn)練、評(píng)測(cè)、推理和部署環(huán)節(jié)的系統(tǒng)協(xié)同。
在與百度智能云的合作中,上海交通大學(xué)穆堯團(tuán)隊(duì)主要負(fù)責(zé)算法原型、基礎(chǔ)模型訓(xùn)練、數(shù)據(jù)定義、模型設(shè)計(jì)和實(shí)驗(yàn)調(diào)優(yōu);百度智能云團(tuán)隊(duì)則更多承擔(dān) AI 基礎(chǔ)設(shè)施層面的支持,包括大規(guī)模算力調(diào)度、訓(xùn)練與測(cè)試資源管理、跨類型顯卡的數(shù)據(jù)共享,以及具身智能模型的訓(xùn)推加速等 AI Infra 工程優(yōu)化。
穆堯認(rèn)為,這種分工對(duì)應(yīng)了當(dāng)前前沿 AI 研究的現(xiàn)實(shí)變化。無(wú)論是視頻生成、大語(yǔ)言模型,還是強(qiáng)化學(xué)習(xí),越前沿的模型越依賴底層基礎(chǔ)設(shè)施。高校團(tuán)隊(duì)擅長(zhǎng)定義問(wèn)題、提出算法原型和探索模型路線;云廠商則在大規(guī)模訓(xùn)練、算力調(diào)度、評(píng)測(cè)、渲染、推理優(yōu)化等環(huán)節(jié)有更長(zhǎng)期的工程積累。
以 AHA-WAM 為例,模型訓(xùn)練和測(cè)試并不只依賴單一類型的算力資源。百度智能云為團(tuán)隊(duì)提供統(tǒng)一資源池,使訓(xùn)練卡和測(cè)試卡可以在同一體系下調(diào)度,并支持不同類型顯卡之間的數(shù)據(jù)共享。這讓模型訓(xùn)練、仿真評(píng)測(cè)和推理優(yōu)化能夠更緊密地銜接起來(lái)。
從實(shí)驗(yàn)室原型走向規(guī)模化落地后,這種協(xié)作會(huì)進(jìn)一步延伸到端云協(xié)同。穆堯提到,如果未來(lái)模型規(guī)模繼續(xù)擴(kuò)大,AHA-WAM 的部分模塊可能部署在云端,由云端服務(wù)器負(fù)責(zé)更重的視頻世界模型推理;邊端則保留動(dòng)作生成能力,負(fù)責(zé)實(shí)時(shí)執(zhí)行。屆時(shí),系統(tǒng)不僅要優(yōu)化模型推理延遲,還要優(yōu)化 K/V cache、實(shí)時(shí)觀測(cè)和動(dòng)作反饋在端云之間的傳輸延遲。
這意味著,AHA-WAM 當(dāng)前提出的異步架構(gòu),未來(lái)可能進(jìn)一步走向端云協(xié)同:云端負(fù)責(zé)更大規(guī)模的世界規(guī)劃,邊端負(fù)責(zé)更低延遲的動(dòng)作執(zhí)行。要讓這套系統(tǒng)真正進(jìn)入商業(yè)化場(chǎng)景,模型結(jié)構(gòu)、推理加速、通信協(xié)議、圖傳鏈路和邊端部署都需要協(xié)同優(yōu)化。
接下來(lái),在物理 AI 領(lǐng)域,穆堯團(tuán)隊(duì)與百度智能云還會(huì)繼續(xù)圍繞三條方向展開(kāi)合作:一是以世界模型為牽引,訓(xùn)練更大規(guī)模的基礎(chǔ)世界模型;二是面向人形機(jī)器人的運(yùn)動(dòng)基礎(chǔ)模型和行為基礎(chǔ)模型,通過(guò)仿真合成緩解真機(jī)數(shù)據(jù)成本過(guò)高的問(wèn)題;三是面向自我進(jìn)化,讓具身模型在大規(guī)模仿真環(huán)境中通過(guò)探索和強(qiáng)化學(xué)習(xí)獲得能力提升。
這些方向共同指向物理 AI 的核心目標(biāo)——模型不僅要具備感知、理解和推理能力,也要能夠在物理世界中執(zhí)行、協(xié)調(diào)復(fù)雜動(dòng)作,并在與環(huán)境的交互中持續(xù)進(jìn)化。
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.