![]()
作者|樊雅婷
微信|FFF111f__
《楚門的世界》里,街道、天氣、鄰居、廣播都按劇本運行,但當楚門開始偏離路線,幕后團隊只能狼狽地臨時調整燈光、天氣和對白,徒勞地維持那個世界的“正常”。
這像極了上一代模型——只能播放,無法應變。但在 LingBot-World 2.0 里,用戶的隨機行為成為驅動世界運轉的核心燃料,而不再是需要補救的意外。
時隔半年,螞蟻靈波科技將 LingBot-World 正式迭代為 LingBot-World 2.0,亦稱 LingBot-World-Infinity。這是一個開源的實時交互世界模型,它把看視頻變成了進世界。對用戶來說,眼前是一個有初始畫面、有背景故事的世界。每一次操作,比如移動、攻擊,都會實時生成下一段畫面,真正在推動世界向前。對系統來說,內置的Agent也在觀察這個世界。它會基于當前狀態,主動提議新事件,比如讓天空下雨、讓敵人增援,讓環境無需玩家干預,也能自行演化。
![]()
LingBot-World-Infinity 是其中唯一在通用領域實現小時級、近似無限生成時長的模型。同時,它還將長時間連續生成、高動態程度、語義交互、較高視覺質量、實時性能和完全開源結合在一起。
具體到這次迭代,LingBot-World 2.0 主要聚焦在三件事上。第一,支持小時級實時生成,長時間運行仍能穩定輸出 720p / 60fps 高清畫面;第二,支持更豐富的 Action 與 Event,攻擊、射箭、施法、射擊以及天氣、環境變化都可以成為交互的一部分;第三,內置 Agent 實時 propose 新事件,讓世界不再靜止,而是持續自我演化、隨用戶而變。
但到底怎么樣?來看看實測效果。
1
動作先發生,世界隨后回應
先來看這個 demo,大片草地、木質路牌、村落小屋、旗幟、遠山和云霧,搭出了一個中世紀奇幻山谷。近景有草叢和路牌,中景有道路和建筑,遠景有森林與群山,空間層次完整,第一眼就讓人覺得這個世界可以繼續探索。
動態部分則把場景從好看推進到可玩。角色可以通過按WASD上下左右穿過山谷,還可以召喚出馬匹,騎在馬上帶起塵土,披風、衣擺和鏡頭跟隨一起運動,讓畫面有了開放世界的速度感。
戰斗上,火槍帶來槍口火光、煙霧;魔法則通過發光粒子、能量軌跡、沖擊波、火焰、符文等特效,展現出明顯的技能范圍、命中反饋和奇幻感。當然,用戶可以隨時設置新的技能,去到新的環境。至此,LingBot-World 2.0 真正成為了一個可以根據用戶意志隨時改變的空間。
但用更高的標準看,問題依然存在,對物理世界的理解還不夠扎實。馬匹奔跑時,腳步和地面的接觸不夠真實;塵土、草地、衣擺沒有完全根據速度和方向自然變化;魔法爆炸也不是每一次都影響了周圍環境......
從 shopping mall 到梵高
這里我自己新建了一個場景,可以看見,跟隨移動視角,畫面里有燈籠、攤位、煙霧、行人和濕潤的石板路。隨后我點擊右側事件提案里提前設置好的的“梵高風格幻覺”,天空中立刻出現藍色旋渦狀、星空筆觸式的幻覺效果,視覺上呼應了梵高式的旋轉星空。
之后我隨機點擊“進入蔬菜商店、水果商店、或高級商場”,能明顯看出分鏡銜接和流暢度非常高,每一次事件觸發后,鏡頭并不是生硬跳切,而是保留了視角行走的連續性,從街市到店鋪、從蔬果貨架到高級商場,都有合理的空間過渡。光照、材質、人物輪廓、貨架結構和商業空間布置也保持了很強的一致性。
整體觀感非常真實。
更重要的是,這種畫面的一致性體現出模型的超強世界知識。它能理解不同商店的區別,也知道什么是高級商場。
既能原創,也能二創
1
用 LingBot-World 2.0 搞一個抽象,看過《潛伏》的才懂。
1
是什么撐起了這個“不停機”的世界
言歸正傳,LingBot-World 2.0 能實現小時級實時運行且畫面幾乎不漂移,根源在于它從訓練范式上做了一個根本性的轉向——把世界模擬嚴格定義為一個因果生成過程。
傳統視頻生成模型普遍采用雙向注意力機制,讓每一幀都能“看到”過去和未來的全部畫面,這種做法在生成短視頻時效果驚艷,但代價是模型從未真正學會什么是因果。它只知道在統計上,“開槍”的畫面后面常常跟著“玻璃碎裂”的畫面,卻不理解前者是后者的原因。一旦進入需要長時間連續自回歸生成的場景,微小誤差就會在幀與幀之間反復累積,畫面逐漸模糊、變形,最終崩壞。
![]()
所以LingBot-World 2.0 的第一層優勢是把世界模擬定義為因果生成。當前畫面只依賴歷史上下文、當前狀態和用戶輸入,未來信息不能提前泄露。為此,團隊設計了 MoBA,即混合雙向與自回歸注意力機制。自回歸部分保證模型按時間向前生成,雙向部分則保留視頻模型對整體畫面關系和視覺質量的把握。簡單說,它既要讓模型知道“接下來該發生什么”,也要盡量保住“畫面應該怎么穩定、怎么好看”。
![]()
第二層優勢是實時性。高質量視頻生成通常需要多步采樣,畫面越復雜,等待越明顯,但交互世界不能讓用戶每按一次鍵就停下來等。LingBot-World 2.0 的應對方法是先訓練高質量基礎模型,再通過 consistency distillation 和 DMD 將多步擴散壓縮為少步生成,部署側則結合并行推理、異步 VAE 解碼、流式傳輸和動態 KV cache 管理,減少從用戶輸入到畫面反饋之間的延遲。
因此,720p/60fps 的意義也不只是畫面更清晰,而是讓交互真正成立。按鍵之后的反饋才會顯得足夠快,場景延續足夠順,事件變化顯得不突兀。
與此同時,1.3B 輕量模型降低了部署門檻,使系統有機會在單張消費級 GPU 上運行。對普通用戶來說,世界模型只有進入這個速度區間,體驗才會從“看生成”接近“玩世界”。
![]()
第三層優勢是 Agentic Harness。LingBot-World 2.0 在視頻生成模型外層加入“大腦-小腦”協同框架。VLM 充當大腦,持續觀察當前畫面、理解用戶動作,并提出下一步可能發生的事件。底層視頻生成模型則更像小腦,負責把這些事件轉化為連續、可信的畫面。換句話說,Pilot Agent 規劃角色行為,Director Agent 補充環境變化,讓系統能根據當前場景臨時生成新的互動可能,而不再被動地續寫畫面。
這也是它區別于傳統視頻生成工具的地方。當你不知道干什么卻又想體驗未知的時候,就可以使用上圖右側面板中的事件提案,在這個例子里,除了已有的按鍵如跳躍、滑翔、云鯨出現等,你還可以按下U或者O ,獲得系統基于當前世界狀態給你隨機生成的下一步選擇,這何嘗不是另一種系統金手指呢。
綜上,一句話總結LingBot-World 2.0 的技術優勢就是它同時解決了長時穩定、實時反饋和事件驅動交互三個問題,讓視頻生成開始具備 AI 原生世界的雛形。
![]()
1
邊界很清晰
在技術報告里,螞蟻靈波也用一小節坦誠地列出了當前模型的局限。
事實上,這是整個賽道需要共同邁過的坎。
首先,長期記憶依然是最大的難題。模型可以在很長時間里保持視覺穩定,但當某個區域離開上下文窗口后,再回到那里,它更像重新生成一片相似區域,未必真正記得“剛才那扇門被打開過”。技術報告里把這個問題概括為:“世界在 appearance 上持久,在 identity 上并不持久。”這也解釋了團隊為什么要引入動態 KV 緩存管理機制,本質上是在給模型裝一個短期記憶輔助器。
其次,關于一致性,存在著身份和風格在超長探索中也還是可能緩慢漂移等問題,以及物理理解也遠未達到真實引擎的確定性,角色和物體偶爾會穿插,碰撞關系會混亂。這都是因為它學會了物理的視覺表現,但還沒學會物理本身。
最后,算力同樣是門檻。14B 主模型更適合高質量體驗和研究驗證,1.3B 輕量模型降低了本地嘗試門檻,但開發者和創作者想在自己手頭的設備上流暢地“開世界”,仍然是一個不小的系統工程。
![]()
1
世界已開服,鑰匙在你手里
不過,這些局限也讓 LingBot-World 2.0 的位置變得更清楚。一個真正要被使用、被復現、被繼續推進的世界模型,不能只展示最漂亮的片段,也要說明哪些能力還在路上。
回到一個更實際的問題:這樣一個世界模型,到底能用來做什么?
答案比想象中更寬。
在游戲和互動內容領域,它可以把劇本驅動變成世界驅動,劇情不再由編劇的分支樹預先鎖定,而是從玩家行為和 Agent 的事件提案中自然生長出來。對創作者來說,這意味著工具范式的遷移,過去你逐幀制作畫面,現在你可以通過 Action 和 Event 控制世界的演化方向,創作從畫每一片葉子變成種一棵會自己生長的樹。
往更深處看,這個模型對具身智能和自動駕駛的價值同樣很大。它可以提供一個持續變化、突發事件不斷的仿真環境,比固定場景的 replay buffer 更接近真實世界那種永遠不知道下一秒會發生什么的復雜性。
同時,它還支持多人進入同一個世界,讓 AI 原生的多人交互有了可以跑起來的原型。
對世界模型研究而言,這套開源系統將提供一個事件驅動、可持續運行的公共實驗底座。研究者可以在上面測試長時因果一致性、開放域動態規律、智能體協同與環境反饋等關鍵問題,不必從零搭建一個能持續響應動作和事件的虛擬世界。
目前,主模型以非商用開源協議發布,用戶可以直接在 Reactor 在線平臺上手體驗,也可以通過靈光 APP 中的“世界模型”功能進入。對于普通用戶來說,這很可能是第一個真正開放的、能實現無限時交互的世界模型。
邊界已經清晰,圖紙已經公開。世界開著,等你進門。
Website:https://technology.robbyant.com/lingbot-world-v2
Model:
https://huggingface.co/collections/robbyant/lingbot-world-v2
https://modelscope.cn/collections/Robbyant/LingBot-World-V2
Code:https://github.com/Robbyant/lingbot-world-v2
在線體驗地址:
https://www.reactor.inc/lingbot-world-v2
Tech Report:
https://github.com/Robbyant/lingbot-world-v2/blob/main/paper.pdf
![]()
點個“愛心”,再走 吧
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.