![]()
作者 | 凌敏
視頻模型賽道正分化成兩條路:一條通向影院,一條通向機器人。
過去兩年,熱錢和掌聲都涌向第一條路,大家比的是如何讓觀眾覺得更真實:畫質要清晰,要有美感,鏡頭語言要足夠豐富。第二條路卻完全不同,它比的是世界規律不能錯:手指不能穿過物體,液體不能違背重力向上流,杯子被碰倒后不能憑空回到原位。同樣的微小錯誤,在前一條可能只是一個穿幫鏡頭,但在后一條,就是致命錯誤,說明機器人從一開始就學錯了物理世界的規則。
通向機器人的路顯然更難走,卻也成了頭部團隊為視頻模型押注的下一個高價值方向。有觀點甚至認為,視頻模型的終局價值就在“世界模擬”。這也是為什么,螞蟻靈波這次的產品發布周,能夠再次引發行業廣泛討論。
7 月 6 日,螞蟻靈波以一支短片的形式,宣布全棧 2.0。隨后一周,密集發布多款模型,包括全新一代空間感知模型 LingBot-Depth 2.0、視覺基座模型 LingBot-Vision、新一代具身基座模型 LingBot-VLA 2.0。其中,7 月 9 日開源的視頻生成基座模型 LingBot-Video,不卷畫面像不像電影,只死磕一個問題:一次動作發生后,世界會怎樣變化?
模型學的,是建立動作、事件與環境變化之間的因果鏈,預判真實物理世界如何演化。簡單來說就是,教會機器人理解做一件事會帶來什么后果。比如,它知道拿起一個玻璃杯,用多大的力度才能抓牢,用多大的力度會捏碎;水龍頭開了,它知道杯子放到水流下面就能接水,移開就接不到水。
這些對人類來說不過是肌肉記憶,但在機器人的世界里,都是需要一點點補全穩定操作的重要拼圖。
評測結果顯示,LingBot-Video 在生成機器人相關視頻時,更能保持動作過程的合理性和任務執行的完整性。在北京大學聯合字節跳動發布的基準 RBench 上,LingBot-Video 的總分是 0.620,超越了 Wan2.6(0.607)、Seedance 1.5 Pro(0.584)、Cosmos3 Super(0.581)。RBench 作為面向機器人操作視頻的綜合評測基準,重點考察模型能否生成符合真實物理規律的機器人行為。
![]()
為了檢驗 LingBot-Video 作為物理世界模型的能力,螞蟻靈波技術團隊從兩個維度進行評測:一般質量衡量基礎生成能力,具身領域考察與具身 AI、真實世界交互相關的高難度場景。內部評估結果顯示,圖生視頻(TI2V)設定下,LingBot-Video 在這兩個維度上,超過包括英偉達 Cosmos 3、Wan 2.2 A14B 在內的五個主流開源視頻模型,拿下 SOTA;文生視頻(T2V)設定下,LingBot-Video 在一般質量中排名第二,但具身領域評分仍優于 Cosmos 等競爭模型。
![]()
這組結果說明,在機械臂操作、避障等需要精確物理軌跡的場景中,LingBot-Video 更擅長把動作、物體狀態與環境變化連成一條因果鏈。哪怕沒有初始畫面,它也能顯示出一定的世界狀態推演能力。
這些恰恰是機器人能把日常小事穩定做對,最缺的一層能力。
項目鏈接:technology.robbyant.com/lingbot-video
GitHub:github.com/robbyant/lingbot-video
Checkpoints:huggingface.co/robbyant/lingbot-video
魔搭社區鏈接:https://www.modelscope.cn/collections/Robbyant/LingBot-Video
1 從“炫技”到“有用”,機器人為什么需要具身視頻基礎模型?
過去兩年,機器人頻頻刷屏。
上春晚表演,跑馬拉松,去山路探險,走進景區與游客互動。機器人在真實世界里一次又一次地驚艷亮相,但圍繞它們的疑問始終沒有消失:除了制造驚嘆,機器人什么時候才能真正“有用”?
讓機器人進入家庭、門店、倉庫和工廠的,不是再完成一個更高難度的舞蹈動作,是把人類習以為常的小事做對。比如,水流突然出現時,它知道什么時候拿杯子去接水;桌面雜亂時,它能判斷什么該收拾,以及該放到哪里。
這些任務看起來平淡,卻比跳舞更接近通用機器人真正的難題。因為機器人面對的,是一個持續變化、充滿不確定性的真實環境。它需要先理解眼前發生了什么,接著還要預測自己做出一個動作后,可能會發生什么,最后執行正確的行動。
視頻模型被具身智能視為關鍵突破口,是因為它能用連續畫面建模世界狀態變化,把“看到什么”“做了什么”“結果如何”連接成一條因果鏈。
從全球頭部團隊近兩年的技術路線看,面向具身智能的視頻模型,至少需要補齊三層能力:理解當前世界狀態,預測動作可能帶來的后果,并在此基礎上為機器人的策略生成、行動評估與規劃提供依據。最終形成從理解、預測到決策的完整閉環。
英偉達曾在 Cosmos 3 中提出,Physical AI 系統需要先理解當前世界發生什么,再預測接下來可能發生什么,最后針對具體環境、機體形態和任務生成動作。Cosmos 3 明確將物理推理、未來世界生成和動作生成統一為一套能力。谷歌 DeepMind 的技術路線,也從側面印證了這一能力鏈:Genie 3 將世界模型定義為利用對世界的理解來模擬環境,使智能體能夠預測環境如何演化、以及自身行動會造成什么影響。
在這條完整的鏈路中,任何一個環節的微小偏差,都可能被后續動作不斷放大。更危險的是,這類偏差很可能在視覺上對人類造成欺騙:視頻依舊流暢、連貫,看似合理,但其中的空間關系、接觸過程和狀態變化,早已偏離真實世界。
2026 年 CVPR Workshop 的 RoboWM-Bench,就曾揭示過“視覺合理≠物理正確”這一關鍵矛盾,并指出主流模型在復雜、長程交互中,容易暴露空間推理錯誤、接觸關系預測不穩定、物體出現不符合物理規律的幾何變形等問題。RBench 在 2026 年對 25 個代表性視頻模型進行了具身場景評測后也發現,許多模型在視覺效果上已經頗具說服力,但在結構一致性、物理合理性和動作完整性上仍有明顯缺陷。研究者據此提出,面向機器人的視頻模型,不能只評估“生成得像不像”,還必須評估“任務是否成立、動作是否能執行”。
這也是為什么,通向影院的通用視頻模型,很難直接成為機器人可信賴的世界模型。對機器人來說,真正需要的,不是視頻看起來有多像電影,是能理解物理世界如何變化,動作符合物理法則。某種意義上,一段物理正確的 480p 預測,比一段杯子穿過桌面的 4K 大片,更有價值。
LingBot-Video 想解決的,正是這個問題。它將物理正確性置于美學優化之上,關注的是“動作如何改變世界”,讓模型學習動作、事件和環境變化,預測真實物理世界如何演化,最終服務于機器人的世界預測、動作理解和自主訓練。
從實際的視頻生成效果來看,LingBot-Video 確實把一些容易被忽略的物理細節,處理得很好。
比如在這段視頻中,勺子在杯中攪拌咖啡時,咖啡會沿著攪拌方向流動,形成自然的漩渦,奶泡也隨之變化。
手掌張開后,沙子會自然地沿著指縫向下灑落,落下的沙子逐漸堆積成小丘,并且隨著持續下落的沙土慢慢擴大。
把水倒進透明杯子中,也能清晰看到液面、氣泡和折射光影的變化。
在一段機器人收納口紅的第一視角視頻中,機械臂從桌面上拿起口紅,再放回收納盒。口紅落入盒中的瞬間,甚至還能看到由下落和觸碰盒體帶來的輕微抖動,極其真實。
這段機器人滑雪的視頻更是難辨真假,雪板經過的地方帶起細碎的雪花,雪花自然飛濺,短暫飄在空中,最后落回雪道。
在 LingBot-Video 官網,還有更多真實 Demo。從騎自行車、滑板、跑步,到拳擊、踢足球、投籃,再到切菜、擦桌子等日常操作,覆蓋了人體運動、人與物交互、工具使用等多類場景。
這些視頻之所以對具身智能重要,是因為它們把動作之后的結果準確地呈現了出來。物體會因接觸產生反饋、沙土離手會自由落體、液體會按照重力和容器邊界流動、光影會隨著液體增加發生變化……對機器人來說,這些細節才是理解世界、預測世界并最終改變世界的基礎,這也是 LingBot-Video 選擇死磕物理法則的原因。
2 為下一代“機器人大腦”構建物理引擎
教會模型物理法則的第一步,需要回答一個更前置的問題:為什么通用視頻模型當不了機器人的世界模型?
LingBot-Video 團隊將其歸結為三重錯配:
第一重是架構錯配。通用視頻模型大多基于擴散模型,擅長從噪聲中一步步還原出連續畫面。傳統稠密架構下,每一次去噪,模型都要調動整套參數,計算成本高、可擴展性差,推理效率也很低。對需要實時響應的機器人來說,稠密架構難以滿足硬件延遲要求。
第二重是數據錯配。通用視頻模型的訓練數據主要來自互聯網,場景覆蓋日常視頻、影視素材、互聯網內容,模型學習目標是生成自然、好看的視頻。但這些數據缺失了機器人真正需要的一手經驗,它不知道手碰到杯子之后會發生什么,很難理解物理世界如何變化。
第三重是訓練目標錯配。通用視頻模型的訓練目標更多還是圍繞畫面是否逼真、是否有美感,以及文本和視頻之間是否對齊。這些目標對準的是內容創作場景,但對具身智能場景來說,視覺合理≠物理正確,模型需要學會真實世界中動作、事件與環境變化之間的因果關系。
三重錯配指向的,是通用視頻模型和面向具身智能視頻模型之間的鴻溝:現有通用視頻模型難以同時獲得可擴展性、物理一致性與具身扎根。LingBot-Video 的解法,就是以三個一體化組件回應這些限制:
采用 MoE 架構,在模型表征能力與推理效率之間實現更優平衡,并完成從零開始的大模型規模擴容;
搭建一套數據特征分析引擎,在通用互聯網視頻基礎上,引入了超 70000 小時具身多模態數據,覆蓋 VLA、VLN、Ego-vision 等具身場景;
設計多維獎勵機制,通過引入物理合理性與任務完成度的雙重約束,對模型進行了針對性的強化對齊訓練。
化繁為簡,以 MoE 架構破解稠密計算難題
對視頻模型來說,物理世界的復雜性在于不同維度的信息必須同時成立。從空間布局到相機運動,從物體軌跡到狀態延續,通通都要滿足物理法則。視頻生成要想模擬連續物理世界,需要同時表征復雜物理過程的視覺現象,比如流體運動、三維空間一致性、不同運動軌跡和豐富材料紋理,等等。
主流的通用視頻模型普遍采用稠密架構,無論當前 token 處理的是什么,所有參數都會走同一條計算路徑。隨著模型和視頻長度擴大,這種方式容易導致嚴重的子任務干擾,計算成本也更高。
MoE 架構的解題思路是稀疏激活,不讓所有參數同時參與計算,通過路由機制為不同 token 選擇少量專家激活,提升模型容量的同時,控制推理成本。近幾年,MoE 架構已經在大語言模型中得到反復驗證,它可以在近似固定的每 token 計算預算下,顯著擴大模型總參數容量。與稠密架構相比,MoE 架構更契合具身智能領域對低成本、高頻率迭代的需求。
LingBot-Video 采用的就是 MoE 架構,總參數 30B,單次生成僅激活約 3B 參數參與計算。就像模型擁有一個大型專家團隊,面對具體問題,只需派出部分最相關的專家出場就能解決。既保留了大模型的容量,也降低了實際運行時的計算壓力。
架構帶來的效率優勢也引發海外網友廣泛討論。網友 Eclipse 評價稱,“30B 總參數、3B 激活參數,對于視頻模型來說是一個相當不錯的效率比。”網友 AI Mastery Guide 也表示,“在 30B 參數中只激活 3B,是讓模型能夠在真實硬件上運行的聰明取舍。”
為了讓這些專家團隊高效協作,LingBot-Video 在 MoE 上又做了幾層約束。
第一層是細粒度專家切分與共享專家隔離。把專家切得更細,每個專家只需深耕一個窄域;同時保留共享專家,沉淀跨領域的通用經驗。
第二層是分組受限路由。MoE 的難點之一,是專家可能分布在不同設備上,路由過于自由會帶來大量跨設備通信。LingBot-Video 先從專家組中篩選候選范圍,再從范圍內選出少量專家,盡量把計算成本控制在可擴展的區間,降低分布式訓練中的通信成本。
第三層是在線偏置校正。訓練過程中動態調整每個專家的選擇門檻,在保證表征能力的同時維持專家負載均衡,避免出現“忙的忙死、閑的閑死”。
第四層是序列級輔助損失。傳統的負載均衡往往只看整個 batch 的平均情況,但由于單個視頻序列包含極其龐大的 token 量,平均值可能掩蓋單條視頻內部的路由不平衡,因此序列級的約束至關重要。LingBot-Video 把平衡約束下沉到單個視頻序列,避免某段視頻在內部形成新的專家擁塞。
這些設計最終轉化為實打實的效率優勢。實驗數據顯示,在活躍計算預算相近的情況下,總參數 13B、活躍參數 1.4B 的 MoE 模型,在整個訓練過程中持續優于活躍參數約 1.3B 的稠密模型;在相同計算約束下,MoE 模型的總參數容量約為稠密模型的 10 倍,能提供更大的物理世界先驗庫。
![]()
進一步對比發現,MoE 13B-A1.4B 和 MoE 30B-A3B 的性能,始終優于活躍參數規模約為其兩倍的稠密模型,MoE 30B-A3B 的表現甚至已經接近 14B 的稠密模型。在序列長度達到百萬 token 的極端條件下,MoE 30B-A3B 的推理速度是同等性能稠密模型的 1.5 到 3 倍以上,與活躍參數等量的 Dense 3B 相比,延遲基本持平。這說明,LingBot-Video 采用的 MoE 架構,能在擴大模型容量的同時,提高推理效率,滿足具身智能產業級部署和高頻迭代的要求。
![]()
MoE 與稠密模型的推理效率對比
超 7 萬小時具身數據,為機器人補上行動經驗
架構解決的,是在模型效果、推理效率以及計算成本之間實現更優平衡,為具身智能的低成本、高頻率迭代提供底層基礎。數據解決的,是為模型注入行動經驗,讓它更好地理解物理世界如何變化。
如前文所說,通用視頻模型的訓練數據主要來自互聯網視頻。這些數據規模巨大,覆蓋了海量的場景、物體,足以讓模型學會生成逼真的畫面。但它們天生缺少機器人真正需要的東西。
具身智能長期面對的數據困境,是真正有用的數據太少,世界上不存在數十億小時的“機器人動作數據”。目前,行業主要通過兩條路徑來補足這部分數據:一條是采集真實機器人數據,通過遙操作讓機器人在現實環境中執行任務并記錄動作序列,成本極高、速度極慢。行業最大規模之一的開放數據集 Open X-Embodiment,聚合了幾十家機構的數據,量級仍遠不及互聯網文本或視頻數據的零頭。另一條是仿真數據,在虛擬環境中大規模生成訓練數據。但這里存在 sim-to-real gap——仿真難以復現真實物理環境的復雜性、接觸的微妙變化和傳感器噪聲,仿真器里學會的技能,放到真實世界中經常失效。
LingBot-Video 走的,是第三條路:在互聯網數據的基礎上,引入超過 70000 小時的具身多模態數據。這些數據覆蓋三大類具身場景,能讓模型學習真實交互中的動作、空間和物理變化。
第一類是VLA 數據,關注視覺、語言與動作的對應關系,能讓模型理解“拿起杯子”語義背后的動作如何執行、狀態如何變化;第二類是VLN 數據,關注智能體根據語言指令在空間中導航的能力,讓機器人能知道向前一步、向后一步,可能會把自己帶到什么位置;第三類是Ego-vision 第一視角數據,這是最接近機器人實際感知世界的方式。
集齊三類具身數據并不容易,更難的是,還要把它們放進同一套世界表征里,讓這些來源不同的內容,都變成一種語言。
LingBot-Video 的數據畫像引擎,承擔的就是這項工作。它為每個圖片或視頻建立統一的五維檔案,覆蓋結構、語義、運動、相機和質量屬性:結構元數據記錄空間分辨率、原生幀率、時長等基礎媒體屬性;語義標簽記錄前景和背景物體、環境、世界知識實體、風格、動作與文字;運動與時間動態拆分相機運動、主體運動和追蹤運動;相機與電影化屬性記錄景別、視角、構圖、鏡頭類型和光線;質量屬性評估美學、清晰度、曝光、水印、字幕、噪聲,以及樣本是否可能是 AI 合成內容。最終,把這些數據變成同一套可查詢、可篩選、可重采樣的結構化記錄。
![]()
數據畫像引擎概覽。每個圖像 / 視頻樣本會在結構、語義、運動、相機、質量五個互補維度上標注為結構化記錄,供后續過濾、平衡采樣與描述生成使用。
有了結構化記錄,下一步,是把它變成模型可以學習的文本。
LingBot-Video 采用密集結構化描述,為所有訓練數據標注密集的結構化 JSON 描述,覆蓋圖像、視頻、VLA 視頻和第一人稱視頻四類數據:
圖像描述包含整圖綜合描述、相機標簽、世界知識和元素清單。每個元素記錄位置、相對大小、形狀顏色、紋理、與其他元素的關系和朝向;如果元素是人,還需要描述姿態、性別、膚色、表情和服裝;如果元素是重復物體群,則標記為 cluster 并給出粗略數量。
視頻描述在圖像 schema 上加入時間信息,精確標注每個元素在何時做了什么動作,讓模型知道視頻中誰在何時做了什么動作。比如,手在 [2.67s,3.67s] 進入畫面放置食物。
VLA 描述沿用視頻 schema,將機械臂與夾爪視為顯著元素,讓模型能按時間戳將動作拆解為清晰階段,比如下移抓取、張開夾爪釋放、回撤,等等。
第一人稱描述同樣使用視頻 schema,相機運動字段專門描述頭部和身體的位移,并將佩戴者雙手作為顯著元素,以時間戳動作描述其與物體的交互。
這種顆粒度的數據描述,最終讓模型學到精確的因果鏈條,知道誰在什么時刻,以什么動作,讓哪個物體從狀態 A 變成了狀態 B。
在數據治理層面,LingBot-Video 進一步引入了世界知識拓撲圖。有了這張圖,數據系統能更好地識別哪些經驗過度集中,哪些經驗長期缺失。
![]()
世界知識拓撲圖
團隊在技術報告中提到,這張世界知識拓撲圖具備“分布感知”能力,它沿語義概念樹和動作樹兩條軸組織樣本,語義概念樹負責回答“視頻里有什么”,覆蓋物體、場景、視覺風格及世界知識實體等;動作樹負責回答“視頻里發生了什么”,覆蓋物體操作、運動、日常活動和人類手勢等。
其中,語義樹包含 5 萬個細粒度葉節點、1000 個中間視覺類別,最終被歸并為 25 個視覺一致的頂層組。動作樹從畫像引擎產生的動作標簽構建,最終得到數百個覆蓋操作、人類手勢、體育和日常活動的規范動作節點。
設計多維獎勵機制,提升模型物理直覺
當模型在性能與推理效率、計算成本之間實現更優平衡,也具備足夠豐富的具身多模態數據,下一步,就是為它設定面向具身智能場景的訓練目標,幫它理解物理世界的運行規則。
通用視頻模型的主流訓練目標,通常圍繞畫面本身,獎勵信號主要來自美學、清晰度和提示詞匹配等。這種訓練方式對具身智能場景并不適配,從“看起來真實”到“物理上真實、任務上完整”,中間橫著的,是一條條物理法則。
這也是為什么,LingBot-Video 在后訓練階段,選擇采用基于多維獎勵的強化學習策略。團隊認為,視頻生成具有天然多維性,也容易出現靜態模式坍塌、時間幻覺和物理不合理等復雜失敗。如果只采用單一標量的整體獎勵模型,難以提供多維度審視。
因此,團隊將評價體系拆解為六個專用獎勵模型,分別把守不同的質量關口:
視覺質量捕捉整體視覺保真與穩健的描述對齊,復合獎勵會懲罰模糊、偽影和低分辨率輸出;
文—視頻對齊確保描述中的每一個動作都在正確的時間窗口出現;
動態程度在不犧牲時間一致性的情況下,打破靜態模式坍塌;
運動連貫性引導模型生成在標準 24fps 播放下,仍顯得自然的物理速度,并懲罰人為慢動作;
人體運動一致性針對不可能拓撲、面部失真、手部畸形、肢體數量錯誤和半透明身體,提供逐步推理以評估空間正確性與時間保真;
物理合理性判斷生成視頻軌跡是否發生在連貫物理場景中,任務相關實體是否持續存在、具備空間錨定,并與預期任務演化一致。
其中最關鍵的,是物理合理性獎勵模型。它不是籠統地判斷視頻是否合理,而是沿著三條軸線逐一審查:第一條是運動因果性,如果沒有外力影響,物體就應當保持靜止或持續原有運動;第二條是物體永久性與非穿透,邊界不會消失,物體不會相互穿透,兩個物體不能發生不合理的重疊;第三條是材料—運動學真實感,物體和帶關節的機器人部件,必須符合合理的材料屬性與剛體運動規律。
這三條軸線,共同構成了一張物理約束網,讓模型不能靠視覺欺騙蒙混過關,必須學習真實的物理因果。
為了讓這六類獎勵真正反饋到模型訓練中,LingBot-Video 采用 GRPO 算法,最大化多維獎勵。視頻擴散強化學習的難點在于,一段視頻要經歷多步去噪。如果最終出現了物體穿透或動作失真,很難判斷究竟是哪一步導致的。LingBot-Video 的做法是,在同一組 rollout 中,只讓一個共享的去噪步驟隨機采樣,其他步驟保持確定性。這樣,不同候選視頻之間的差異可以更明確地歸因到那一個隨機步驟,獎勵也能更準確地回傳到產生差異的位置。
此外,六種獎勵不會直接相加,會先分別歸一化,再按權重融合,避免某一種數值范圍更大、優化更容易的獎勵長期主導訓練,壓過物理合理性、動作可執行性等更關鍵但更稀疏的具身信號。
通過針對性的強化對齊訓練,LingBot-Video 突破了傳統視頻模型主要圍繞畫面美觀度、提示詞遵循度和動作連貫性進行優化的局限,將物理合理性、動作可執行性和交互結果納入模型訓練目標,提升模型對真實世界演化的建模能力。
3 開源 LingBot-Video,機器人社區多了一個“世界模擬器”
架構、數據,以及訓練方式上的三重優化,讓 LingBot-Video 能在建模容量與推理效率間實現平衡,螞蟻靈波將其定位為下一代“機器人大腦”的基礎,希望 LingBot-Video 作為具身視頻模擬器,能在機器人社區承擔三類角色:
數據引擎:大規模合成高保真、低成本訓練數據,緩解機器人數據稀缺。
策略評估器:作為視覺模擬器,在不引入真實世界風險的情況下,以安全可控的方式評估機器人策略。
動作規劃器:預測“接下來會發生什么”,輔助機器人實時決策和規劃。
三類角色串在一起,把視頻模型從內容生產工具,變成了物理推理與交互的試驗場。更重要的是,螞蟻靈波選擇將這套能力完全開源。
據悉,LingBot-Video 是業界首款面向具身智能的大規模 MoE 視頻基礎模型,開創性地打通了數字內容生成與實體機器人執行控制兩大領域,并已完全開源,供整個研究社區使用,降低具身視頻模型的研究門檻。
過去很長一段時間,具身視頻模型的研究受制于算力、數據和工程壁壘。一個可復現、可評測、可迭代的開放基座,能讓更多研究者和開發者在前沿技術框架上驗證自己的想法,不必重復造輪子。團隊希望通過開源 LingBot-Video,與社區共同推進具身物理引擎和下一代機器人腦的邊界。
這也延續了螞蟻靈波一貫的開源路徑。本周,團隊接連開源了視覺基座模型 LingBot-Vision,以及新一代具身基座模型 LingBot-VLA 2.0。前者采用了幾何建模方式,也是業內首個把“邊界結構”作為預訓練目標的視覺基礎模型,實現了空間感知訓練范式的突破;后者作為今年 1 月開源的 LingBot-VLA 1.0 的全面升級,在構型泛化、自由度支持和落地效率等方面實現了顯著提升。
從視覺理解到操作執行,再到今天的物理世界模擬,螞蟻靈波一直在具身智能的不同環節持續補齊基礎能力,并把多個重要拼圖交給社區,變成更多人可以接入和改造的公共底座。
不過,螞蟻靈波團隊也坦誠地表示,LingBot-Video 當前還存在一定局限性,仍面臨長時序一致性難以保持,柔性物體和液體等復雜物理交互不夠精確,視頻預測能力向真實機器人閉環的轉化未完全打通,以及具身視頻模型評測標準還在建設中。這些未竟之題,也是螞蟻靈波選擇開源、與社區共建的原因。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.