聞樂 發(fā)自 凹非寺
量子位 | 公眾號 QbitAI
先說個(gè)事兒,我昨天做了個(gè)挺好玩兒的夢:踩著滑板在城市大道上飛!馳!
醒過來還意猶未盡,結(jié)果沒想到AI不光幫我還原了畫面,還把我拉進(jìn)夢里玩了一把。
我踩著滑板往前沖,換方向、加速、跳躍、甚至秀了個(gè)Ollie(豚跳)~
![]()
視頻地址:https://mp.weixin.qq.com/s/J5v3jVnHSdluRKxRz9cCSg
屬實(shí)給我整精神了,AI啥時(shí)候會干的這事??
不賣關(guān)子了,這是HappyOyster 1.0(快樂生蠔)實(shí)現(xiàn)的,阿里ATH推出的可實(shí)時(shí)構(gòu)建和交互的開放式世界模型產(chǎn)品。
看到世界模型四個(gè)字,可能有朋友好奇:這和我之前玩的Sora那些有啥區(qū)別?不都是AI生成畫面嘛?
嗯……還真不是一回事。
咱先簡單聊兩句行業(yè)現(xiàn)狀啊,過去這一年多,AI視頻賽道卷得確實(shí)熱鬧,各種產(chǎn)品輪番上場,畫面精度一個(gè)比一個(gè)高,看著確實(shí)挺驚艷。
但用多了就會發(fā)現(xiàn)一個(gè)共性問題:它們都是「單程票」。
你寫一段描述,模型渲染出一段視頻,生成完,就完了,然后你就只能看,更不能跟畫面里的角色互動。
而且時(shí)間一拉長,畫面大概率就會崩壞,比如角色前一秒拿著劍后一秒空手了,走兩步臉都換了一張。
這也是為啥市面上AI視頻基本都是短片段,不是不想做長,是長了真繃不住啊……
說白了,當(dāng)前文生視頻的天花板,就是一段好看但不可更改的影像素材;
而HappyOyster 1.0做的是一件完全不同的事——
打造一個(gè)完整可演繹、可探索、可互動的數(shù)字世界。
畫面生成出來的那一刻,體驗(yàn)才剛開始。你可以一邊看一邊下指令,世界實(shí)時(shí)反饋并持續(xù)演化。
就好像以前你是觀眾,現(xiàn)在你成了世界的…主人。
![]()
那這只快樂生蠔到底有多快樂呢??下面就繼續(xù)實(shí)打?qū)崪y一波!
世界是活的,你就是主角
HappyOyster 1.0主打兩大核心模式:Adventure(世界探索)和Directing(實(shí)時(shí)導(dǎo)演)。
Adventure是「用動作探索,世界即刻延展」的開放漫游模式,你親自下場當(dāng)主角;
Directing是「用鏡頭敘事,故事隨心掌控」的導(dǎo)播執(zhí)導(dǎo)模式,你站在世界之上當(dāng)導(dǎo)演。
一個(gè)管“身體”,一個(gè)管“腦子”,覆蓋了兩種截然不同的創(chuàng)作和體驗(yàn)訴求。
咱先來體驗(yàn)Adventure模式。
我丟了一張吉卜力風(fēng)格的草原圖進(jìn)去,畫面生成的一瞬間直接把我拉了進(jìn)去,整個(gè)畫面是活的,在等我操作。
![]()
那我就不客氣了,直接動手!
1.0版本新增了一套很豐富的交互按鍵,有加速、下蹲、攻擊、跳躍,操作手感跟你玩的3A大作相當(dāng)接近。
我按了一下前沖,少年邁腿就跑起來;按攻擊鍵,少年開始揮劍;再按跳躍,少年騰空而起,落地那一刻角色屈膝動作,鏡頭有個(gè)上升和下墜的變化,這細(xì)節(jié)屬實(shí)拉滿了。
關(guān)鍵是,這些全都不是預(yù)先做好的動畫素材,是模型根據(jù)你的操作實(shí)時(shí)推演出來的。
為啥這么說呢?因?yàn)橥粋€(gè)場景我反復(fù)試了好幾次,每次動作角度不一樣,角色的姿態(tài)也不一樣。
而且模型有個(gè)很聰明的設(shè)定,它會根據(jù)場景內(nèi)容自動匹配可玩的交互方式。
比如我這個(gè)畫面里有馬車,世界就會解鎖騎馬互動彩蛋。少年走到馬車旁,觸發(fā)對應(yīng)操作指令,就能直接上馬騎行!!
![]()
視頻地址:https://mp.weixin.qq.com/s/J5v3jVnHSdluRKxRz9cCSg
如果創(chuàng)建的世界里有汽車,那么就會自動匹配開關(guān)車燈、鳴笛的玩法,主打一個(gè)「畫面有什么,就能玩什么」。
![]()
視頻地址:https://mp.weixin.qq.com/s/J5v3jVnHSdluRKxRz9cCSg
而且探索過程中還能隨時(shí)截屏留存畫面,也能保存世界,一鍵對外分享鏈接,別人點(diǎn)進(jìn)來就能看到你創(chuàng)建的完整世界。
意思是,方便發(fā)朋友圈了(doge)。
![]()
如果說Adventure是讓你下場當(dāng)主角,那Directing就更過癮了,直接讓你當(dāng)導(dǎo)演。
Directing支持多模態(tài)參考,@一張圖片就能鎖定角色外觀,咱直接就是一個(gè)POV戀愛互動先安排上!
![]()
我給她設(shè)定了一個(gè)近景特寫鏡頭,全程第一視角對視,然后隨手打了幾條互動指令,效果be like:
![]()
視頻地址:https://mp.weixin.qq.com/s/J5v3jVnHSdluRKxRz9cCSg
好好好,AI生視頻這下都吃上自助餐了,我狂吃!
而且1.0版本在Directing模式上做了幾個(gè)相當(dāng)重磅的升級,體驗(yàn)完之后我只想說:這才是創(chuàng)作者的終極玩具!
我先用一條prompt啟動了一段劇情:
在舞臺上,兩個(gè)人面對面激烈爭吵。
看了大概二十秒之后,我覺得劇情可以轉(zhuǎn)折了。
于是我輸入了一條新指令:
他們突然釋懷了,緊緊擁抱在一起。
接收到新指令后,兩個(gè)角色的表情開始緩和,身體從對抗姿態(tài)慢慢轉(zhuǎn)向靠近,最后緊緊擁抱在一起。
![]()
視頻地址:https://mp.weixin.qq.com/s/J5v3jVnHSdluRKxRz9cCSg
而且,整個(gè)過程中,不光是場景,兩個(gè)角色的臉、衣服、體態(tài)、發(fā)型完全沒有變!!
好戲還沒完——
1.0另外殺手锏功能是回溯和劇情分支。
比如,我可以直接回退到爭吵的那個(gè)節(jié)點(diǎn),換條完全不同的指令,畫面就會重新演化。
或者從同一個(gè)節(jié)點(diǎn)續(xù)寫,設(shè)計(jì)出A、B兩條完全不同的故事線。
![]()
等等,這不就是創(chuàng)作者夢寐以求的平行宇宙嘛!!!
而且所有這些操作都是流式生成的,即說即演,不用等渲染。你隨時(shí)插話,劇情隨時(shí)響應(yīng),這對內(nèi)容行業(yè)來說,屬實(shí)是黑科技啊……
更貼心的是,官方還寫了份體驗(yàn)指南放在網(wǎng)頁上,教你怎么創(chuàng)建更好的世界~
![]()
為什么能讓世界動起來?
上面體驗(yàn)了這么多,估計(jì)有朋友已經(jīng)按捺不住了:
這玩意兒到底是怎么做到的?跟文生視頻在技術(shù)上有啥區(qū)別?
咱先把最根本的概念差異說清楚:
文生視頻的工作方式是文本→視頻的單向條件映射,你輸入一段描述,模型一次性離線渲染出一段固定的像素序列。
世界模型學(xué)的則是一套完全不同的東西,是當(dāng)前狀態(tài)+用戶動作→下一個(gè)狀態(tài)的轉(zhuǎn)移規(guī)律。
![]()
△圖片AI生成
這就要求模型必須同時(shí)具備三重能力:物理規(guī)律的隱式建模、長程因果鏈路的追蹤、外部干預(yù)的即時(shí)響應(yīng)。
首先要說的就是閉環(huán)世界狀態(tài)建模。
要讓一個(gè)世界持續(xù)運(yùn)行,最樸素的思路是記住所有歷史畫面,每生成新一幀,就回頭看前面所有幀來保持連貫性。
但問題是,這么干計(jì)算量會指數(shù)級膨脹,時(shí)間一長直接寄。
HappyOyster 1.0在這里把世界狀態(tài)壓縮成隱狀態(tài)摘要(Latent State),在生成鏈路上遞歸傳遞,支撐長程一致性。
就像接力跑一樣,跑下一棒之前,上一棒把「關(guān)于現(xiàn)在世界的一切」寫成一張紙條遞過去,一棒一棒往后傳。
每生成新的一幀,模型只需要拿到上一幀的那張紙條加上你新發(fā)出的指令,就能推演出下一幀。
所以幾分鐘下來世界不會亂、因果關(guān)系不會斷。
而且1.0版本因?yàn)檫@個(gè)紙條可以被存檔,所以暫停、回溯、分支敘事這些功能就自然而然實(shí)現(xiàn)了。本質(zhì)上就是在某個(gè)時(shí)間點(diǎn)把紙條存一份副本,想從哪繼續(xù)就從哪繼續(xù)。
一個(gè)架構(gòu)設(shè)計(jì),直接把產(chǎn)品的交互想象空間整個(gè)撐開了。
![]()
△圖片AI生成
第二項(xiàng)核心技術(shù),是內(nèi)生一致性,解決了生成畫面里角色頻繁換臉的痛點(diǎn)。
文生視頻最頭疼的問題就是主體漂移,人物走幾步臉就變了,衣服顏色也跟著跑偏。
HappyOyster 1.0以持久的參考表征參與全程注意力來解這個(gè)問題。通俗點(diǎn)說,就是給每個(gè)角色、物品、場景元素都發(fā)了一張「身份卡」。
不管鏡頭怎么切、角色怎么轉(zhuǎn)身、被其他物體遮擋多久再出現(xiàn),模型每次生成新畫面時(shí)都會對著身份卡檢查,保證角色不變樣不變形。
還有開放因果動作空間,打通動作與語言的表達(dá)邏輯。
很多交互式系統(tǒng)的做法是預(yù)定義一個(gè)動作集,比如能跳、能跑,但只能做這些。
HappyOyster 1.0把動作指令和自然語言放進(jìn)了同一個(gè)語義接口。
比如,你說騎上那匹馬,模型就自己推演出上馬的完整動作序列和馬開始跑的物理反饋。
動作空間是開放的,語言本身就是遙控器,不需要任何人工預(yù)設(shè),模型自己就能推演因果。
最后說說長時(shí)序音視頻協(xié)同。
HappyOyster 1.0的音頻和視頻是在同一個(gè)世界狀態(tài)下聯(lián)合解碼生成的,不是先出畫面再配音。
這意味著腳步聲跟著你走、雨聲跟著天氣變、打擊音效跟著攻擊動作來,真正做到了聲畫物理合規(guī)。
這四大技術(shù)一起協(xié)同發(fā)力,這個(gè)世界才能真正活起來。
不過技術(shù)做得好不好,光靠體驗(yàn)感受還不夠,得有量化標(biāo)準(zhǔn)來衡量。
但世界模型作為一個(gè)新興領(lǐng)域,目前行業(yè)里還缺乏一套針對“世界邏輯”的系統(tǒng)性評測基準(zhǔn)。
針對這個(gè)痛點(diǎn),HappyOyster團(tuán)隊(duì)正在牽頭與南京大學(xué)共建世界模型評測基準(zhǔn),這也說明,HappyOyster不只是在做產(chǎn)品,更承擔(dān)起定義賽道標(biāo)準(zhǔn)的責(zé)任。
誰能第一個(gè)吃到這只生蠔?
從傳統(tǒng)文生視頻生成一段固定影像,到世界模型搭建可進(jìn)入、可操控、持續(xù)自主運(yùn)轉(zhuǎn)的完整數(shù)字空間,HappyOyster 1.0正是這條全新路線的落地先行者。
它把AI的生成能力從單向輸變成了雙向?qū)崟r(shí)交互。
而且,一旦世界模型走通了這條路,很多行業(yè)的想象空間就變大了。
比如說游戲行業(yè),不用搭建龐大的美術(shù)資產(chǎn)庫、配置復(fù)雜的物理引擎,給HappyOyster 1.0丟一張概念圖,很快就能跑出一個(gè)具備物理反饋和NPC交互的可玩場景。
![]()
在內(nèi)容生成賽道上,如果一個(gè)劇本能分叉出十條故事線,觀眾自己選走向,那就可能催生一個(gè)全新的互動內(nèi)容業(yè)態(tài)。
除此之外,文旅景區(qū)做虛擬漫游、博物館做沉浸式歷史還原……都可以用HappyOyster 1.0進(jìn)行沉浸式體驗(yàn)。
現(xiàn)在,HappyOyster 1.0已經(jīng)正式上線,用手機(jī)號注冊就能玩!此外,API計(jì)劃在近期開放。接下來無論是游戲創(chuàng)作、短劇生成、文娛體驗(yàn),還是數(shù)字人直播、虛擬陪伴,都可以用上世界模型,給用戶帶來全新的交互體驗(yàn)。
這意味著人人都有機(jī)會親手搭建、操控自己的專屬虛擬世界,想想就「狠」帶勁!
阿里這次屬實(shí)是打開了大家的想象力,以后誰還滿足于只看視頻啊……
體驗(yàn)地址:
https://www.happyoyster.cn
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.