京東段楠WAIC演講:從數(shù)字AI到物理AI,Scaling Law要加上硬件這一維
![]()
段楠,京東集團(tuán)副總裁、京東探索研究院副院長(zhǎng),2026年1月升任該職,直接向劉強(qiáng)東匯報(bào)。此前他曾任階躍星辰Technical Fellow,更早的十二年在微軟亞洲研究院自然語(yǔ)言計(jì)算團(tuán)隊(duì)擔(dān)任資深首席研究員和研究經(jīng)理。學(xué)術(shù)兼職包括中國(guó)科學(xué)技術(shù)大學(xué)、西安交通大學(xué)兼職博導(dǎo)及天津大學(xué)兼職教授,發(fā)表學(xué)術(shù)論文200余篇,Google Scholar引用超28000次。2019年獲評(píng)CCF-NLPCC杰出青年科學(xué)家,2023年入選DeepTech中國(guó)智能計(jì)算創(chuàng)新人物。
2026年7月18日上午,段楠在WAIC京東論壇發(fā)表演講《從數(shù)字AI到物理AI》,這是他就任副院長(zhǎng)后首次在公開(kāi)場(chǎng)合系統(tǒng)闡述京東探索研究院的技術(shù)路線。
這場(chǎng)演講的核心判斷是:Scaling Law需要從數(shù)字世界的“數(shù)據(jù)+模型+算法”三位一體,擴(kuò)展到物理世界,把硬件的規(guī)模化也加進(jìn)來(lái)。段楠把物理AI的規(guī)模化拆成四個(gè)維度——物理數(shù)據(jù)規(guī)模化、持續(xù)學(xué)習(xí)規(guī)模化、物理基礎(chǔ)模型能力、硬件協(xié)調(diào)規(guī)模化,并用“附身智能”作為從數(shù)字智能到物理智能的中間階段:先讓模型部署到手機(jī)、電腦、可穿戴設(shè)備等終端,再走向機(jī)器人和真實(shí)物理硬件。
演講中有幾個(gè)值得注意的信息點(diǎn):一是京東探索研究院首次公開(kāi)了實(shí)時(shí)視頻編輯模型和高共情語(yǔ)音交互模型Joy AI Talker,兩者均尚未對(duì)外發(fā)布;二是宣布今年9、10月份將推出物理基礎(chǔ)模型的最新成果;三是披露了2000小時(shí)具身操作數(shù)據(jù)集已收到全球數(shù)百個(gè)機(jī)構(gòu)的申請(qǐng),以及配套仿真平臺(tái)Joy AI Sim支持人類操作數(shù)據(jù)與具身操作數(shù)據(jù)的雙向轉(zhuǎn)換。從組織層面看,劉強(qiáng)東親自擔(dān)任探索研究院院長(zhǎng),段楠作為副院長(zhǎng)直接向其匯報(bào),說(shuō)明京東已將AI研發(fā)提到了最高決策層級(jí)。
以下為段楠演講原文。
附:段楠WAIC 2026演講原文
今天非常榮幸在這里給大家做報(bào)告,題目是“從數(shù)字AI到物理AI”,說(shuō)的是人工智能的規(guī)模化演進(jìn)。
如果我們回顧人工智能過(guò)去七十多年的發(fā)展,經(jīng)歷了四次技術(shù)浪潮。最早的專家系統(tǒng)到統(tǒng)計(jì)學(xué)習(xí),一直到今天的深度學(xué)習(xí)和基礎(chǔ)模型,整個(gè)演進(jìn)可以看成在數(shù)據(jù)、算力和模型上的持續(xù)規(guī)模化。拿基礎(chǔ)模型為例,受益于互聯(lián)網(wǎng)海量數(shù)據(jù)像自建工具訓(xùn)練和強(qiáng)化學(xué)習(xí)后訓(xùn)練,這樣的結(jié)合,以及現(xiàn)在從百億、千億到萬(wàn)億的模型架構(gòu),現(xiàn)在基礎(chǔ)模型包括語(yǔ)言、語(yǔ)音、多模這樣的領(lǐng)域都取得了跨越式提升,體現(xiàn)出非常強(qiáng)的范化能力和跨任務(wù)的遷移能力。
同時(shí),互聯(lián)網(wǎng)數(shù)據(jù)還是數(shù)字世界信息的載體,沒(méi)辦法讓模型學(xué)習(xí)到如何真正交互和駕馭物理世界,如果人工智能未來(lái)面向更高水平的通用性,必須從數(shù)字世界走向物理世界,涉及到的技術(shù)就是物理AI。
相比數(shù)字AI,物理AI對(duì)規(guī)模化提出了新的要求。
第一,它需要做到物理數(shù)據(jù)規(guī)模化,因?yàn)槲锢鞟I不僅要從海量數(shù)據(jù)中學(xué)習(xí)通用常識(shí)知識(shí),還要從蘊(yùn)含著非常豐富的物理信息的真實(shí)世界數(shù)據(jù)中學(xué)習(xí)物理規(guī)律和因果關(guān)系,比如三維空間結(jié)構(gòu)、物理屬性、運(yùn)動(dòng)軌跡等。
第二,它需要做到持續(xù)學(xué)習(xí)的規(guī)模化,因?yàn)樗枰鎸?shí)世界交互中不斷獲得反饋,進(jìn)行持續(xù)進(jìn)化、持續(xù)調(diào)優(yōu)。
第三,物理基礎(chǔ)模型本身也要有新的進(jìn)展。因?yàn)楹蛿?shù)字AI不同,物理AI的特點(diǎn)是要對(duì)空間的理解重建,包括對(duì)物理規(guī)律的建模,對(duì)硬件的模擬、操作以及剛剛像楊老師提到的跨本體、跨任務(wù)和跨場(chǎng)景的泛化能力都要有很好的支持。
最后有一個(gè)新的維度,硬件協(xié)調(diào)需要規(guī)模化。不管是采集大量具身數(shù)據(jù)還是訓(xùn)練具身模型,最終把這些東西部署到本體上,都需要在機(jī)器人硬件和可穿戴設(shè)備上同步做到規(guī)模化的協(xié)同。
所以一句話總結(jié):Scaling Law這件事情,從數(shù)字世界的數(shù)據(jù)、模型和算法三位一體化的范式發(fā)展到物理AI,要把硬件的規(guī)模化也加進(jìn)來(lái)。
在整個(gè)物理AI大的趨勢(shì)和浪潮下,京東探索研究院核心使命是構(gòu)建自主可控的,AI基礎(chǔ)模型的矩陣。我們希望這樣的模型,能夠助力京東集團(tuán)完成從數(shù)字AI到物理AI的技術(shù)躍遷,讓人工智能技術(shù)覆蓋我們?cè)诩瘓F(tuán)內(nèi)部遇到的,像零售、物流、工業(yè)、健康等核心的場(chǎng)景,最終實(shí)現(xiàn)助力京東集團(tuán),成為全球最大的物理世界運(yùn)營(yíng)中心的愿景。
圍繞著這個(gè)使命,整個(gè)研究院更加聚焦多模態(tài)基礎(chǔ)模型的研究以及具身模型研究,我們也把整個(gè)技術(shù)路徑分三個(gè)階段:第一階段是數(shù)字智能階段,主要以語(yǔ)言模型、代碼模型、多模模型為基礎(chǔ),讓模型能夠感知、推理、生成數(shù)字內(nèi)容,并通過(guò)智能體的方式,自主完成數(shù)字世界的任務(wù);第二階段附身智能階段,把整個(gè)基礎(chǔ)模型部署到包括手機(jī)、電腦、可穿戴設(shè)備、智能駕艙等各類終端,持續(xù)實(shí)時(shí)觀測(cè)用戶和環(huán)境,最終實(shí)現(xiàn)人與設(shè)備、設(shè)備和設(shè)備之間,非常實(shí)時(shí)自如的交互和協(xié)作;第三階段是物理智能,說(shuō)白了最重要是把模型部署到真實(shí)的物理硬件,讓這些硬件感知世界,對(duì)這個(gè)世界的狀態(tài)做預(yù)測(cè),最終完成自主化的物理世界的任務(wù)。
接下來(lái)匯報(bào)一下京東探索研究院在過(guò)去半年的階段性工作以及小小的展望。我們?cè)趫D像理解編輯方面,今年4月份提出了Joy AI image Edit,這個(gè)模型和之前傳統(tǒng)的圖像理解生成模型相比,最核心的貢獻(xiàn)是兩點(diǎn):第一把圖像的空間理解和圖像的空間編輯整合到同一個(gè)模型中,并且在這兩類空間感知相關(guān)的評(píng)測(cè)集上,持平甚至超過(guò)了Gemini pro 2.5、banana pro和Seedance 4.5的閉源大模型。第二我們通過(guò)引入圖像編輯能力,可以反向促進(jìn),模型對(duì)圖像內(nèi)部空間理解的能力,初步驗(yàn)證了生成可以輔助理解的新范式,這個(gè)模型已經(jīng)在社區(qū)做了相關(guān)開(kāi)源。
第二個(gè)工作是音畫聯(lián)合生成,是今年6月份發(fā)的。這個(gè)模型的特點(diǎn)是支持分鐘級(jí)的音視頻聯(lián)合生成,并且在人工評(píng)測(cè)的指標(biāo)上,超越了HappyHorse 1.0等相關(guān)的音畫同步生成的基線模型。我們模型在長(zhǎng)程視頻內(nèi)容一致性生成上,做了對(duì)于記憶能力,尤其多模態(tài)記憶能力的創(chuàng)新,包括音畫同步,在后訓(xùn)練和實(shí)時(shí)推理里的創(chuàng)新,以及最后如何讓模型能夠做非常自由的交互,為我們后續(xù)做下半年的視頻事件模型奠定了技術(shù)基礎(chǔ)。
下一個(gè)模型是我們最新6月份推出的實(shí)時(shí)視頻交互模型,這個(gè)模型很有意思,它最核心的點(diǎn)是在全球首個(gè)開(kāi)源的,能夠做到真正實(shí)時(shí)自主交互的多模態(tài)理解大模型。這個(gè)模型能夠?qū)Τ掷m(xù)的視頻流做實(shí)時(shí)理解,通過(guò)自主交互滿足用戶提出的問(wèn)題和用戶存在的需求,這個(gè)模型在社區(qū)也進(jìn)行了開(kāi)源,在很多實(shí)時(shí)視頻交互場(chǎng)景上,取得了超越字節(jié)、豆包和谷歌的實(shí)時(shí)交互能力,大家感興趣可以下載體驗(yàn)。
視頻編輯方面,最近完成了一個(gè)工作,但沒(méi)有對(duì)外。而WAIC是很好的機(jī)會(huì),做一個(gè)介紹,實(shí)時(shí)視頻編輯模型,支持超過(guò)30FPS對(duì)流式視頻做實(shí)時(shí)編輯的能力,我們也在各種相關(guān)視頻實(shí)時(shí)編輯基準(zhǔn)測(cè)試集上,和最新出現(xiàn)的三四個(gè)閉源的模型做對(duì)比,都取得了非常好的效果。我認(rèn)為這樣的技術(shù),它不僅是視頻生成發(fā)展的重要方向,也是未來(lái)我們?cè)诟缴碇悄苷嬲龅饺B(tài)的實(shí)時(shí)交互以及我們?cè)诰呱碇悄茴I(lǐng)域里,做大規(guī)模數(shù)據(jù)合成,提供了非常底層的技術(shù)積累。我們也會(huì)在近期開(kāi)源我們的技術(shù)報(bào)告。
實(shí)時(shí)語(yǔ)音交互方面,這是第二個(gè)我們還沒(méi)有正式發(fā)布,近期完成的工作,我們叫Joy AI Talker,它是語(yǔ)音和語(yǔ)言的原生預(yù)訓(xùn)練架構(gòu),它支持語(yǔ)音的理解、推理和生成一體化的架構(gòu),也支持非常低延時(shí),語(yǔ)義級(jí)別的交互能力。它最重要的特點(diǎn)是能夠非常精準(zhǔn)的控制我們生成的語(yǔ)音內(nèi)容,包括情緒、語(yǔ)氣、語(yǔ)速等表現(xiàn)力相關(guān)的特征,能夠在語(yǔ)音交互和情感高共情的語(yǔ)音交互場(chǎng)景上,我們?nèi)〉昧耸澜缫涣鞯乃剑@個(gè)模型會(huì)在后續(xù)為附身智能、具身智能提供非常高效、自然、高共情的語(yǔ)音交互體驗(yàn)。
高共情的語(yǔ)音交互能力是我們會(huì)持續(xù)發(fā)力和持續(xù)迭代的能力。在整個(gè)具身智能的發(fā)展方向,我們今年4月和6月分別發(fā)了兩個(gè)工作,后面我的同事會(huì)做詳細(xì)的介紹。這個(gè)數(shù)據(jù)第一批是2000小時(shí),覆蓋了倉(cāng)儲(chǔ)、家庭、藥房等特色場(chǎng)景,以及300多個(gè)典型的操作任務(wù)。現(xiàn)在收到了全球數(shù)百個(gè)高校、企業(yè)和科研院所的數(shù)據(jù)申請(qǐng)。
與此同時(shí),我們右邊推出了Joy AI sim的仿真架構(gòu),它能夠支持人類操作數(shù)據(jù)和具身操作數(shù)據(jù)雙向的自由轉(zhuǎn)換,既解決了機(jī)器人操作數(shù)據(jù)獲取難的問(wèn)題,也為后續(xù)我們做整個(gè)具身數(shù)據(jù)金字塔,包括我們把大規(guī)模仿真和真實(shí)世界的訓(xùn)練做協(xié)同,做好了底層平臺(tái)級(jí)的準(zhǔn)備。
圍繞京東自采數(shù)據(jù)集,我們今年4月份同步發(fā)了Joy AI RA0.1的具身操作模型。這個(gè)模型主要目的是驗(yàn)證具身基礎(chǔ)模型和其他基礎(chǔ)模型,隨著數(shù)據(jù)規(guī)模擴(kuò)大和多樣化,具身模型能力在理解、推理、預(yù)測(cè)到最終操作效果上都取得同樣的效果。我們初步驗(yàn)證了這樣的結(jié)論,后續(xù)會(huì)隨著具身數(shù)據(jù)集整個(gè)體量不斷擴(kuò)大,進(jìn)一步驗(yàn)證效果。最終目標(biāo)是希望在具身領(lǐng)域達(dá)到像GPT3或者Chat GPT能力引線的時(shí)刻。
除了對(duì)模型和數(shù)據(jù),我們也非常關(guān)注整個(gè)評(píng)測(cè)的建設(shè),受益于整個(gè)京東平臺(tái)非常多元化的業(yè)務(wù)體系和業(yè)務(wù)環(huán)境,我們現(xiàn)在正在搭建針對(duì)包括零售、物流、工業(yè)、健康等真實(shí)場(chǎng)景以及針對(duì)具身智能場(chǎng)景的評(píng)測(cè)數(shù)據(jù)集和平臺(tái),我們希望這樣的工作能夠?yàn)榛A(chǔ)模型在千行百業(yè)和具身智能發(fā)展中,提供更加系統(tǒng)和科學(xué)的評(píng)測(cè)體系。我們?cè)谙掳肽甑臅r(shí)候會(huì)發(fā)布這樣的評(píng)測(cè)平臺(tái)。
整個(gè)在研究院的工作最終還要落地到真實(shí)的場(chǎng)景中,積極響應(yīng)國(guó)家對(duì)科技創(chuàng)新和產(chǎn)業(yè)創(chuàng)新深度融合的號(hào)召,希望后面能夠和在座各位有更多在模型落地應(yīng)用的合作。
小小預(yù)告一下,今年下半年會(huì)陸續(xù)發(fā)布一系列新的工作。包括數(shù)據(jù)方面,數(shù)據(jù)規(guī)模化方面會(huì)持續(xù)推出新的階段性結(jié)果;物理基礎(chǔ)模型相關(guān)的工作上,目前正在緊鑼密鼓地推進(jìn),我們希望在今年9、10月份推出物理基礎(chǔ)模型上的最新模型;最后我們會(huì)持續(xù)構(gòu)建千行百業(yè)和具身相關(guān)的評(píng)測(cè)平臺(tái),我們希望加速京東集團(tuán)甚至包括社區(qū),從數(shù)字世界到物理世界的技術(shù)躍遷進(jìn)展。
最后,京東探索研究院歡迎大家多關(guān)注、多交流、多合作。謝謝大家!
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.