![]()
6月,北京智源大會(huì)現(xiàn)場(chǎng),圍繞具身智能的技術(shù)路線之爭(zhēng)再次成為行業(yè)焦點(diǎn)。
過(guò)去一年,隨著機(jī)器人產(chǎn)業(yè)快速升溫,一個(gè)問(wèn)題持續(xù)引發(fā)討論:機(jī)器人究竟應(yīng)該走VLA路線,還是世界模型路線?
對(duì)此,作為本次大會(huì)具身產(chǎn)業(yè)CEO論壇的首位開場(chǎng)主旨演講嘉賓,智平方創(chuàng)始人兼CEO郭彥東博士一上臺(tái)便化身“終結(jié)者”,對(duì)這一行業(yè)爭(zhēng)論拋出明確答案:
世界模型不是VLA的競(jìng)爭(zhēng)路線,而是VLA體系中的核心組成部分;而在世界模型與VLA融合之后,類腦架構(gòu)將成為下一代機(jī)器人大腦的重要演進(jìn)方向。
這一判斷背后,也對(duì)應(yīng)著智平方過(guò)去三年持續(xù)高壓強(qiáng)的技術(shù)布局——從端到端VLA,到融合世界模型,再到最新發(fā)布的類腦大模型NeuroVLA,一條清晰的機(jī)器人大腦進(jìn)化路線正在成型。
終結(jié)世界模型與VLA之爭(zhēng)
世界模型無(wú)疑是當(dāng)下全球具身智能領(lǐng)域最熱門的話題之一。
不少研究者認(rèn)為,機(jī)器人首先需要建立對(duì)物理世界的理解能力,才能進(jìn)一步產(chǎn)生可靠行為;也有人認(rèn)為,VLA直接從視覺(jué)和語(yǔ)言生成動(dòng)作,是更高效、更現(xiàn)實(shí)的技術(shù)路徑。
郭彥東博士認(rèn)為,從生命演化的角度來(lái)看,行動(dòng)能力并不是孤立產(chǎn)生的。生命首先需要感知環(huán)境、理解環(huán)境,然后才會(huì)產(chǎn)生行動(dòng)。
換句話說(shuō),世界模型負(fù)責(zé)理解世界,而VLA負(fù)責(zé)作用于世界,兩者并非對(duì)立關(guān)系,而是天然統(tǒng)一的整體。
他在演講中指出,當(dāng)前被廣泛討論的“世界模型”,本質(zhì)上并不是物理規(guī)律驅(qū)動(dòng),而是靠海量數(shù)據(jù)訓(xùn)練出來(lái)的。“數(shù)據(jù)足夠多,模型就知道水杯越過(guò)桌面會(huì)下落、手機(jī)屏幕用力敲可能會(huì)碎——這不是物理規(guī)律的總結(jié),而是大數(shù)據(jù)學(xué)習(xí)的結(jié)果。”
基于這一判斷,郭彥東重新給出了VLA的定義:VLA是多種模態(tài)融合的大數(shù)據(jù)驅(qū)動(dòng)的端到端模型架構(gòu)的總稱。在這個(gè)定義下,世界模型與VLA沒(méi)有本質(zhì)區(qū)別,更不是替代關(guān)系。
“世界模型解決的是對(duì)物理環(huán)境進(jìn)行稠密、包含時(shí)間維度的4D預(yù)測(cè),它是一個(gè)非常好的空間基礎(chǔ)模型,是VLA空間感知的一部分,能幫助機(jī)器人大腦越來(lái)越好。”
他進(jìn)一步用具體任務(wù)解釋了為什么兩者必須融合:“如果不把世界模型合并在VLA里面,很多任務(wù)完全做不了。比如泡茶要先拿茶包再倒水,做咖啡要先拿杯子再接水——這些推理認(rèn)知邏輯靠語(yǔ)言模型更容易完成。世界模型擅長(zhǎng)的是短程預(yù)測(cè),比如水杯靠近桌邊可能掉落。只有把兩者合并,機(jī)器人才既能做短程物理預(yù)測(cè),又能做長(zhǎng)程任務(wù)規(guī)劃。”
除了在VLA中融合世界模型的預(yù)測(cè)能力,智平方還利用世界模型生成真實(shí)環(huán)境中難以采集的邊緣數(shù)據(jù)(corner case)。“比如采集杯子數(shù)據(jù)時(shí),采集到的可能都是桌子中間的,忘記采集桌子邊緣的。這時(shí)就可以用世界模型生成桌子邊緣的樣本,來(lái)補(bǔ)足VLA。”
基于這一判斷,智平方很早便開始推動(dòng)世界模型與VLA的融合研究。
2025年11月,智平方聯(lián)合北京大學(xué)率先推出融合世界模型的新一代架構(gòu)Video2Act,首次實(shí)現(xiàn)“先預(yù)測(cè)、后執(zhí)行”的機(jī)器人模型范式。
![]()
在智平方看來(lái),世界模型最大的價(jià)值從來(lái)不是生成視頻,而是生成行動(dòng)。
機(jī)器人不僅需要預(yù)測(cè)未來(lái)會(huì)發(fā)生什么,更需要基于這種預(yù)測(cè)決定下一步應(yīng)該做什么。
因此,Video2Act并非傳統(tǒng)意義上的視頻生成模型,而是一個(gè)融合4D世界模型的VLA架構(gòu)。通過(guò)空間稠密信息建模以及動(dòng)作時(shí)序的持續(xù)輸入,機(jī)器人能夠提前理解未來(lái)狀態(tài)變化,并將這種預(yù)測(cè)能力直接轉(zhuǎn)化為行動(dòng)決策。
這是世界模型第一次真正成為機(jī)器人行動(dòng)系統(tǒng)的一部分。
在第三方評(píng)測(cè)中,Video2Act相較于硅谷同類標(biāo)桿模型取得超過(guò)30%的性能領(lǐng)先。
更值得關(guān)注的是,2026年,由英國(guó)皇家兩院院士、圖靈人工智能世界領(lǐng)先研究員Philip Torr、強(qiáng)化學(xué)習(xí)領(lǐng)域奠基者Pieter Abbeel等全球頂級(jí)學(xué)者聯(lián)合完成的世界模型權(quán)威綜述《World Model for Robot Learning: A Comprehensive Survey》中,Video2Act被作為“世界模型+VLA融合路線”的代表性成果重點(diǎn)引用。
這意味著,關(guān)于“世界模型還是VLA”的爭(zhēng)論,正在被新的技術(shù)范式所取代。
真正重要的問(wèn)題已經(jīng)不再是誰(shuí)替代誰(shuí),而是誰(shuí)能夠率先實(shí)現(xiàn)兩者的深度融合。
世界模型與VLA融合之后,下一代機(jī)器人大腦來(lái)了
如果說(shuō)世界模型與VLA的融合解決了機(jī)器人“看懂世界”的問(wèn)題,那么機(jī)器人如何像人一樣穩(wěn)定、高效地行動(dòng),則成為新的挑戰(zhàn)。
這也是智平方近期重點(diǎn)突破的方向。
在智源大會(huì)上,郭彥東重點(diǎn)介紹了智平方最新發(fā)布的類腦具身智能系統(tǒng)NeuroVLA,目前唯一同時(shí)具備主動(dòng)感知、故障自恢復(fù)與時(shí)序記憶三大類生物運(yùn)動(dòng)能力的具身智能系統(tǒng)。
![]()
他提出一個(gè)觀點(diǎn):
“大家做人形機(jī)器人,天天想著如何長(zhǎng)得像人,但沒(méi)有人想如何讓腦子更像人。”
在現(xiàn)有VLA架構(gòu)中,機(jī)器人雖然已經(jīng)具備較強(qiáng)的理解能力,但面對(duì)真實(shí)世界的復(fù)雜環(huán)境,仍然普遍存在響應(yīng)慢、動(dòng)作抖動(dòng)、能耗高等問(wèn)題。
原因在于,大多數(shù)機(jī)器人仍然依賴一個(gè)統(tǒng)一的大模型同時(shí)處理感知、推理與控制。
而人類大腦并不是這樣工作的。
人腦中,皮層負(fù)責(zé)思考,小腦負(fù)責(zé)協(xié)調(diào)運(yùn)動(dòng),脊髓負(fù)責(zé)本能反射,不同系統(tǒng)在不同時(shí)間尺度上協(xié)同運(yùn)作。
借鑒這一機(jī)制,智平方構(gòu)建了全球首個(gè)“皮層—小腦—脊髓”三級(jí)類腦架構(gòu)NeuroVLA。
其中,皮層負(fù)責(zé)語(yǔ)義理解和任務(wù)規(guī)劃;小腦負(fù)責(zé)高頻運(yùn)動(dòng)協(xié)調(diào)與動(dòng)態(tài)修正;脊髓則負(fù)責(zé)毫秒級(jí)運(yùn)動(dòng)執(zhí)行與安全反射。
這一設(shè)計(jì)讓機(jī)器人首次具備了類似生物系統(tǒng)的層級(jí)智能能力,從架構(gòu)層面提升機(jī)器人在真實(shí)物理世界中的穩(wěn)定性、實(shí)時(shí)性與能效。
實(shí)驗(yàn)結(jié)果顯示,NeuroVLA能夠?qū)C(jī)器人運(yùn)動(dòng)抖動(dòng)降低75%以上,在碰撞發(fā)生后20毫秒內(nèi)完成反射響應(yīng),同時(shí)顯著降低系統(tǒng)功耗。
![]()
對(duì)于機(jī)器人而言,這些數(shù)字背后意味著一次質(zhì)變。
過(guò)去的機(jī)器人能夠思考,卻難以流暢行動(dòng)。未來(lái)的機(jī)器人不僅能夠思考,還能夠像人一樣即時(shí)反應(yīng)、自主修正和持續(xù)適應(yīng)。
機(jī)器人開始從“會(huì)推理”,走向“會(huì)本能反應(yīng)”。
從某種意義上說(shuō),NeuroVLA所解決的已經(jīng)不再是簡(jiǎn)單的模型問(wèn)題,而是機(jī)器人大腦架構(gòu)問(wèn)題。
它試圖回答的是:機(jī)器人如何擁有真正接近生物系統(tǒng)的智能。
而這正是類腦智能的價(jià)值所在。
從端到端VLA,到Video2Act,再到NeuroVLA。過(guò)去三年,智平方持續(xù)圍繞機(jī)器人大腦進(jìn)行系統(tǒng)性創(chuàng)新。
![]()
如果說(shuō)VLA讓機(jī)器人擁有了行動(dòng)能力,世界模型讓機(jī)器人擁有了理解和預(yù)測(cè)能力,那么NeuroVLA則進(jìn)一步賦予機(jī)器人接近生物系統(tǒng)的反應(yīng)與控制能力。
這三次演進(jìn)背后,其實(shí)對(duì)應(yīng)著同一個(gè)方向:
如何讓機(jī)器人擁有一個(gè)更像人腦的“大腦”,讓機(jī)器人越來(lái)越接近真正的人類智能。
在本次智源大會(huì)的舞臺(tái)上,郭彥東給出的不僅是一套技術(shù)方案,更是一條關(guān)于下一代機(jī)器人大腦的演進(jìn)路線。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.