![]()
商學(xué)院觀察
劉勁 段磊/文
長期以來,社會公眾和政府監(jiān)管對游戲抱有一種審慎甚至負(fù)面的態(tài)度,原因在于游戲行業(yè)確實(shí)存在青少年易沉迷、部分內(nèi)容有不良價(jià)值觀導(dǎo)向、部分商業(yè)化模式有爭議等問題。但更深層的原因在于產(chǎn)業(yè)定位:游戲長期被視為“不創(chuàng)造實(shí)體價(jià)值”的虛擬行業(yè),難以與芯片、能源、人工智能等“硬科技”相提并論。
然而,人工智能的快速發(fā)展正在從根本上重塑我們理解游戲價(jià)值的底層邏輯。游戲過去已經(jīng)為AI的算力基礎(chǔ)設(shè)施和算法發(fā)展提供了重要助力。現(xiàn)在伴隨AI進(jìn)入新階段、面對新挑戰(zhàn),游戲很可能在智能體(Agent)訓(xùn)練、具身智能以及應(yīng)對數(shù)據(jù)枯竭等方面,提供更為關(guān)鍵的基礎(chǔ)設(shè)施價(jià)值。
游戲?qū)I發(fā)展的歷史貢獻(xiàn)
游戲產(chǎn)業(yè)在多個關(guān)鍵節(jié)點(diǎn)上,為AI的飛躍提供了不可或缺的條件。
第一次重大推動發(fā)生在算力層面。在20世紀(jì)90年代,游戲玩家對實(shí)時渲染、復(fù)雜光影和高幀率的需求,催生了一種全新的計(jì)算架構(gòu)——圖形處理器(GPU)。GPU的本質(zhì)是大規(guī)模并行計(jì)算。
到了21世紀(jì)初,AI研究者發(fā)現(xiàn),原本為游戲畫面服務(wù)的GPU非常適合高效訓(xùn)練深度神經(jīng)網(wǎng)絡(luò)——矩陣乘法這類深度學(xué)習(xí)的基本運(yùn)算,在GPU上的執(zhí)行速度比傳統(tǒng)CPU快數(shù)十倍甚至上百倍。
從那一刻起,游戲產(chǎn)業(yè)培育出的算力體系,成為深度學(xué)習(xí)革命的重要基礎(chǔ)設(shè)施。可以說,沒有游戲產(chǎn)業(yè)持續(xù)數(shù)十年的圖形計(jì)算投入,就沒有今天AI大模型訓(xùn)練所依賴的GPU算力集群。
這段歷史在英偉達(dá)的財(cái)報(bào)里留下了清晰的印記。2016財(cái)年,英偉達(dá)的游戲業(yè)務(wù)收入約28.2億美元,數(shù)據(jù)中心業(yè)務(wù)只有3.4億美元,前者是后者的8倍多。到2025財(cái)年,數(shù)據(jù)中心已占總營收約88%,游戲只剩8.7%。這條從游戲引擎到AI引擎的曲線,是游戲?yàn)锳I輸送算力的最好注腳。
第二次重大推動則發(fā)生在算法層面。2015年,DeepMind在《自然》雜志發(fā)表了DQN(深度Q網(wǎng)絡(luò))研究,第一次大規(guī)模地把深度學(xué)習(xí)和強(qiáng)化學(xué)習(xí)成功結(jié)合起來——讓AI在幾十款雅達(dá)利(Atari)游戲中自己摸索操作策略,最終達(dá)到接近專業(yè)人類測試員的水平,宣告了“深度強(qiáng)化學(xué)習(xí)”時代的到來。
2016年,AlphaGo通過學(xué)習(xí)海量人類職業(yè)棋譜,再輔以強(qiáng)化學(xué)習(xí),擊敗圍棋世界冠軍李世石,成為AI史上的里程碑。那場對局中著名的“第37手”,正是AI跳出人類經(jīng)驗(yàn)、自主創(chuàng)新的經(jīng)典時刻。
2017年的AlphaGoZero更進(jìn)一步,完全拋棄人類棋譜,僅靠“自己和自己下棋”,在幾天訓(xùn)練后就達(dá)到超越人類的水平,把這種“獨(dú)立思考”的能力推向了極致。這說明,游戲不僅能幫助AI模仿人類,還能讓AI在規(guī)則清晰、反饋明確的環(huán)境里,發(fā)現(xiàn)連人類都想不到的新策略。
可見過去十來年,游戲賦能AI算法發(fā)展的關(guān)鍵詞是“強(qiáng)化學(xué)習(xí)”。原因在于兩者的底層邏輯高度契合:游戲本質(zhì)上是一個規(guī)則清晰、反饋及時、獎勵明確的環(huán)境系統(tǒng),恰好為強(qiáng)化學(xué)習(xí)“在試錯中根據(jù)獎勵調(diào)整行為”提供了明確的目標(biāo)、可重復(fù)的交互和清晰的獎勵信號。
隨著大模型、智能體、具身智能乃至世界模型的興起,游戲?qū)I的賦能已經(jīng)無法只用算力和強(qiáng)化學(xué)習(xí)來定義,這種賦能正在變得更加廣泛和深入。其邏輯可以從兩個維度來理解。
其一是環(huán)境維度:游戲及其引擎技術(shù)是一套高質(zhì)量、低成本的環(huán)境系統(tǒng),為AI提供了一個可以反復(fù)試錯、快速迭代的訓(xùn)練場和實(shí)驗(yàn)室,這對智能體、智能駕駛、具身智能的訓(xùn)練與測試都有高度價(jià)值。
其二是數(shù)據(jù)維度:游戲通過人與游戲的互動、玩家之間的博弈、乃至AI在其中的自我對弈等各種交互方式,源源不斷地產(chǎn)生海量、高質(zhì)量、低成本的數(shù)據(jù)。
這兩個維度不是簡單的并列關(guān)系,二者猶如工廠與產(chǎn)品:游戲環(huán)境是生產(chǎn)數(shù)據(jù)的系統(tǒng),數(shù)據(jù)則是環(huán)境產(chǎn)出的核心資產(chǎn)。核心價(jià)值的最終落點(diǎn)當(dāng)然是數(shù)據(jù),因?yàn)閿?shù)據(jù)是驅(qū)動AI發(fā)展的燃料;但只有從環(huán)境和數(shù)據(jù)兩個維度同時剖析,才能真正看清游戲中數(shù)據(jù)的特點(diǎn),以及游戲?qū)I的價(jià)值。
環(huán)境維度
今天的大模型,主要依靠海量的靜態(tài)數(shù)據(jù)訓(xùn)練而成——互聯(lián)網(wǎng)上的文本、圖像、視頻等。這類數(shù)據(jù)讓AI學(xué)會“看懂”“聽懂”這個世界。
但要讓機(jī)器智能更進(jìn)一步,具備“能決策、能動手”的能力,僅靠靜態(tài)數(shù)據(jù)是不夠的:它必須在與世界的持續(xù)交互中學(xué)習(xí)。
問題在于,讓AI直接在真實(shí)世界里交互學(xué)習(xí),代價(jià)極其高昂。游戲及其引擎技術(shù)所構(gòu)建的虛擬環(huán)境,恰好提供了一個理想的替代方案。相比真實(shí)世界,它至少有五個方面的優(yōu)勢。
第一,成本極低。真實(shí)世界的試錯,往往既貴又危險(xiǎn)。自動駕駛領(lǐng)域一次錯誤的決策,可能就意味著一場真實(shí)的事故;在虛擬環(huán)境中,同樣的試錯幾乎不需要付出代價(jià)。以理想汽車公開的智能駕駛測試數(shù)據(jù)為例:2023年該公司實(shí)車路測每公里成本約18.4元,而到2025年上半年,其借助世界模型進(jìn)行仿真測試,完成約4000萬公里仿真里程(實(shí)車僅約2萬公里),單公里成本降至約0.53元,僅為實(shí)車路測的約三十五分之一。成本的量級差異,直接決定了訓(xùn)練能否規(guī)模化。
第二,高度可控、可重復(fù)。在真實(shí)環(huán)境中做對比實(shí)驗(yàn),常常受制于不可控的外部變量。比如,要驗(yàn)證不同天氣對算法的影響,你只能被動等待相應(yīng)天氣的出現(xiàn);在虛擬環(huán)境里,研究人員只需調(diào)整底層參數(shù)(光照強(qiáng)度、車流密度、降水概率等),就能快速生成任意目標(biāo)場景。AI訓(xùn)練由此從“被動等待”轉(zhuǎn)向“主動生成”,效率大幅提升。
第三,風(fēng)險(xiǎn)可控,能提前暴露問題。AI在部署到現(xiàn)實(shí)世界之前,需要充分的安全驗(yàn)證,但真實(shí)環(huán)境中的安全測試代價(jià)極高——不可能為了測試自動駕駛的碰撞反應(yīng)而刻意制造事故,也不可能在真實(shí)電網(wǎng)中釋放攻擊性代碼來檢測漏洞。游戲沙盒完美繞過了這些限制:研究者可以在虛擬環(huán)境中主動構(gòu)造極端天氣、傳感器故障、惡意輸入等邊緣場景,零風(fēng)險(xiǎn)地探測AI的行為邊界,觀察其是否異常或有害。這種提前暴露問題、收斂風(fēng)險(xiǎn)的機(jī)制,對即將大規(guī)模進(jìn)入現(xiàn)實(shí)的AI系統(tǒng)不可或缺。
第四,具備天然的可解釋性。當(dāng)前AI最受詬病的問題之一是“黑箱”。模型輸出一個結(jié)果,但人類研究者很難說清它為什么做出這個決定。游戲環(huán)境為破解這一難題提供了獨(dú)特條件:在游戲中,每一個狀態(tài)變量都可以被精確記錄、暫停、回放和復(fù)現(xiàn),研究者得以逐幀追問“AI此刻看到了什么、為何這樣決策”。這種在真實(shí)世界中幾乎無法實(shí)現(xiàn)的因果可追溯性,讓游戲成為可解釋性研究的天然實(shí)驗(yàn)室——它不僅讓AI“做題”,還讓人看清AI的“解題過程”。
第五,實(shí)時交互、有效反饋。與靜態(tài)的圖像或文本數(shù)據(jù)不同,游戲環(huán)境的核心特征是“交互性”:AI在游戲中不僅“看”到了什么,更重要的是它能夠“做”什么,并且立刻看到行動帶來的結(jié)果。推一下?lián)u桿,角色就移動;踩下剎車,車輛就減速;選錯策略,比分就落后。這種即時的“動作—反饋”閉環(huán),是訓(xùn)練決策智能的必要條件。在反復(fù)練習(xí)中,AI得以學(xué)會判斷時機(jī)、理解空間、制定策略——這些能力在純靜態(tài)數(shù)據(jù)上無法習(xí)得。
游戲環(huán)境對AI的價(jià)值有兩個層面:一是利用現(xiàn)成的商業(yè)游戲作為訓(xùn)練環(huán)境,二是利用游戲引擎技術(shù)構(gòu)建專用的仿真平臺。前者雖是娛樂產(chǎn)品,物理規(guī)律和社會運(yùn)行機(jī)制可能被夸張?zhí)幚恚ㄈ缳愜囉螒驊騽』呐鲎残Ч廊豢捎脕碛?xùn)練AI的通用決策能力。
例如,騰訊“絕悟”AI最初是為《王者榮耀》這類復(fù)雜多人在線對戰(zhàn)游戲研發(fā)的決策智能系統(tǒng)——它需要在實(shí)時、不完全信息、多智能體協(xié)作的極高難度環(huán)境中做出最優(yōu)決策。
研究者發(fā)現(xiàn),“絕悟”在游戲中錘煉出的最優(yōu)路徑規(guī)劃能力,可以遷移到病理全片掃描診斷領(lǐng)域:騰訊AILab據(jù)此研發(fā)的RLogist系統(tǒng)(發(fā)表于AAAI2023)將病理切片的掃描路徑優(yōu)化,轉(zhuǎn)化為類似游戲中的“探索—決策”問題,決策效率相比傳統(tǒng)方式提升約400%,在保證診斷準(zhǔn)確率的同時縮短了病理閱片的等待時間。
后者則是利用游戲引擎技術(shù),搭建高度貼近真實(shí)物理世界的專用仿真場景——比如一個與真實(shí)施工現(xiàn)場1:1還原的礦山、一條與真實(shí)城市道路完全一致的街區(qū)。這種方式既保留了游戲環(huán)境低成本、高可控、可交互的核心優(yōu)勢,又通過精密的物理建模彌合了“虛擬—現(xiàn)實(shí)”之間的鴻溝。
以Unity和Unreal為代表的游戲引擎,為AI的產(chǎn)業(yè)級仿真提供了高保真的物理仿真、實(shí)時光線追蹤和可編程的環(huán)境參數(shù)系統(tǒng)。例如騰訊推出的自動駕駛仿真平臺TADSim,就是一個典型的“游戲引擎到專用仿真”遷移案例:該系統(tǒng)利用游戲引擎的厘米級三維重建、工業(yè)級車輛動力學(xué)模型和AI驅(qū)動的交通流仿真技術(shù),可以在云端支持上千輛自動駕駛主車及上百萬輛交通車同步運(yùn)行,日均測試能力超過1000萬公里,遠(yuǎn)遠(yuǎn)突破了真實(shí)路測的限制。
數(shù)據(jù)維度
環(huán)境的價(jià)值最終要通過它產(chǎn)出的數(shù)據(jù)來兌現(xiàn)。游戲數(shù)據(jù)的獨(dú)特價(jià)值體現(xiàn)在兩個天然屬性和兩個數(shù)據(jù)來源上。
第一個屬性是天然的“多模態(tài)對齊”。要提升AI對現(xiàn)實(shí)世界的理解,必須依賴多模態(tài)數(shù)據(jù),因?yàn)楝F(xiàn)實(shí)世界本身就是多模態(tài)且自動對齊的。人類理解世界,從來是視覺、聲音、動作、物理反饋的綜合,AI也需建立起不同模態(tài)之間的關(guān)聯(lián)。
然而現(xiàn)實(shí)中,多模態(tài)數(shù)據(jù)往往來源分散,視覺、聲音、動作很難同時采集,即便采集完成也需大量人工標(biāo)注對齊,難以規(guī)模化。
游戲則不同:它運(yùn)行時同時產(chǎn)生畫面、聲音、動作、物理反饋,且天然處于同一時間軸、同一場景中,彼此自動對應(yīng)。對AI而言,這相當(dāng)于一套圖像、音頻、動作與環(huán)境狀態(tài)完全同步的“多模態(tài)教科書”,正是當(dāng)下訓(xùn)練“視覺—語言—動作”大模型等所急需的關(guān)鍵原材料。
第二個屬性是清晰的“狀態(tài)—動作—反饋”因果結(jié)構(gòu)。AI要真正理解世界,不能只知道“發(fā)生了什么”,還得理解“為什么會發(fā)生”,即某個行為如何導(dǎo)致某個結(jié)果;只有建立起這種因果關(guān)聯(lián),AI才能形成真正的決策與推理能力。
但這種數(shù)據(jù)在現(xiàn)實(shí)中極難采集和標(biāo)注:現(xiàn)實(shí)變量高度復(fù)雜,一個結(jié)果往往受多個行為共同影響,關(guān)鍵反饋也容易遺漏。游戲天然具備這種結(jié)構(gòu),會完整記錄“看到什么(狀態(tài))—做了什么(動作)—得到什么結(jié)果(反饋)”,任何一次失敗都能精確回放。這就好比給AI一本帶完整解題步驟和答案的“教科書”,讓它高效學(xué)習(xí)因果規(guī)律、調(diào)整策略。
游戲數(shù)據(jù)的另一個獨(dú)特性在于,它既有人類經(jīng)驗(yàn)的沉淀,又可以有機(jī)器智能的探索。
一方面,人類與游戲交互產(chǎn)生的數(shù)據(jù),是人類經(jīng)驗(yàn)的數(shù)字沉淀,可以支撐AI的模仿學(xué)習(xí)。這就像讓AI站在無數(shù)頂尖人類玩家的肩膀上看世界,快速習(xí)得那些“只可意會、難以言傳”的經(jīng)驗(yàn)性策略。以自由度極高的沙盒游戲《我的世界》(Minecraft)為例,AI通過“看人類怎么玩”來模仿,就能學(xué)會大量難以用規(guī)則描述的經(jīng)驗(yàn)。
人類的數(shù)字沉淀還可以幫助AI更好地實(shí)現(xiàn)“人類偏好對齊”,讓決策更貼近人類的價(jià)值判斷。早在2017年,OpenAI與DeepMind就在雅達(dá)利游戲等虛擬環(huán)境中做過一個經(jīng)典實(shí)驗(yàn):人類只需對AI的不同操作片段(比如賽車游戲中的駕駛表現(xiàn))表達(dá)“這個更好、那個更差”的偏好,模型就能逐步調(diào)整策略,讓行為越來越符合人類的判斷標(biāo)準(zhǔn),并最終提升任務(wù)表現(xiàn)。無論是模仿學(xué)習(xí)還是偏好對齊,人類交互數(shù)據(jù)的核心價(jià)值,都在于把人類的經(jīng)驗(yàn)“喂”給AI,讓它得以站在人類智慧的肩膀上快速進(jìn)化。
另一方面,AI與游戲交互產(chǎn)生的數(shù)據(jù),是機(jī)器智能與環(huán)境互動產(chǎn)生的合成數(shù)據(jù),對AI發(fā)展同樣重要。利用算法和游戲引擎批量生成的合成數(shù)據(jù),可以覆蓋現(xiàn)實(shí)中稀缺的長尾場景——罕見的極端天氣、危險(xiǎn)路況都能在虛擬環(huán)境中大量“造”出來,彌補(bǔ)真實(shí)數(shù)據(jù)在邊緣場景上的天然稀缺。
而AI在游戲中“自我博弈”產(chǎn)生的數(shù)據(jù)則可用于強(qiáng)化學(xué)習(xí)訓(xùn)練:AI親自下場,自己和自己對打,每一局的輸贏都轉(zhuǎn)化為新的經(jīng)驗(yàn)數(shù)據(jù),驅(qū)動模型在無需人類監(jiān)督的情況下持續(xù)自我進(jìn)化。前文的 AlphaGoZero正是例證——完全依靠自我博弈,最終突破了人類經(jīng)驗(yàn)的能力邊界。可以說,自我博弈產(chǎn)生的數(shù)據(jù),是AI邁向超人類表現(xiàn)的關(guān)鍵驅(qū)動力。
總結(jié)
正如英偉達(dá)早已不是一家游戲顯卡公司,游戲產(chǎn)業(yè)的價(jià)值坐標(biāo)也正在越過娛樂產(chǎn)業(yè)的邊界,向科技基礎(chǔ)設(shè)施的方向遷移。
在環(huán)境維度,它為AI提供了低成本、可交互、有即時反饋的虛擬系統(tǒng),讓智能得以反復(fù)試錯、快速成長;在數(shù)據(jù)維度,它持續(xù)產(chǎn)出結(jié)構(gòu)化、多模態(tài)自對齊的海量數(shù)據(jù),為智能提供源源不斷的養(yǎng)料。
當(dāng)然,虛擬終究不能完全替代現(xiàn)實(shí),游戲環(huán)境更像是真實(shí)世界的高效放大器而非替身。但隨著AI向具身智能與世界模型演進(jìn),游戲承載的這兩重價(jià)值會進(jìn)一步凸顯。
這也提醒我們是時候轉(zhuǎn)換看待游戲的視角:不再只盯著它的娛樂外殼,而是看清它作為AI隱性基礎(chǔ)設(shè)施的內(nèi)核。
中國擁有全球最大的游戲市場和最活躍的游戲產(chǎn)業(yè)生態(tài),在移動游戲、電競、游戲AI等領(lǐng)域已經(jīng)積累了深厚的技術(shù)儲備與人才梯隊(duì)。若能超越“游戲即娛樂”的單一認(rèn)知,系統(tǒng)性地推動游戲技術(shù)向AI基礎(chǔ)設(shè)施轉(zhuǎn)化,這很可能成為中國在全球AI競爭中一個獨(dú)特的優(yōu)勢來源。
(劉勁系長江商學(xué)院會計(jì)與金融學(xué)教授、投資研究部主任,段磊系深之度咨詢合伙人)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.