WAIC 2026現(xiàn)場,模型能力在具身智能、AI硬件等領(lǐng)域應(yīng)用是最熱門的方向,“AI與人如何更好地交互”成為眾多參展者關(guān)注的話題。
過去兩年,AI語音助手、數(shù)字人、陪伴產(chǎn)品層出不窮,但大多數(shù)交互仍停留在你問我答的機(jī)械邏輯里。當(dāng)通用大模型能把知識問答做得越來越好的時候,一個更本質(zhì)的問題浮出水面——AI能不能真正理解人,而不只是回答問題?
筆者在WAIC 2026現(xiàn)場體驗(yàn)SoulX實(shí)時數(shù)字人及全新AI硬件B Soul后,一個清晰的信號正在浮現(xiàn):AI交互正在從功能型應(yīng)答逐漸向情緒感知、實(shí)時多模態(tài)過渡,而Soul的野心不止于做一款更好的AI社交APP,而是成為一家模型與應(yīng)用一體化的AI生態(tài)公司。
![]()
一場有“活人感”的對話
在Soul的展臺上,筆者面對Soul的數(shù)字人,在沒有預(yù)設(shè)問題、沒有引導(dǎo)話術(shù),就是隨便聊聊的場景下,進(jìn)行了一場簡單的對話。
令人意外的是,Soul的數(shù)字人不是那種逐句等待你說完再接話的節(jié)奏,它會在你話說到一半時自然地插入回應(yīng),會在你語氣變化時調(diào)整自己的語調(diào),甚至在你停頓猶豫的間隙里,補(bǔ)上一句“你是不是在想什么?”。而當(dāng)筆者在它回答問題的時候,打斷它,進(jìn)而轉(zhuǎn)移到其它話題的時候,它也總是能接住后續(xù)話題,并繼續(xù)展開反饋。
這種對話的感覺,不像在跟機(jī)器說話,更像跟一個朋友聊天。甚至,它給筆者的反饋要超過某些邊看手機(jī)邊與人聊天的體驗(yàn)。
如果把體驗(yàn)量化,可以通過一個數(shù)據(jù)來體現(xiàn):0.87秒。這是Soul實(shí)時數(shù)字人模型之一——SoulX-FlashTalk的首幀視頻輸出延時,也是業(yè)內(nèi)首個實(shí)現(xiàn)亞秒級超低延時的14B數(shù)字人模型達(dá)到的數(shù)字。聽起來只是不到一秒鐘的差距,但在實(shí)時視頻交互中,延遲是決定用戶體驗(yàn)的核心變量。
人類在面對面交談時,對方的反應(yīng)時間通常在200到500毫秒之間;一旦延遲超過1.5秒,人們開始覺得對方在想,而不是在聽。傳統(tǒng)大模型驅(qū)動的數(shù)字人,延時普遍在2到5秒之間,這正是為什么大多數(shù)AI對話都像你發(fā)一條、它等一會兒再回一條的原因。
這種體驗(yàn)在當(dāng)前的AI產(chǎn)品中并不普遍。當(dāng)前市面上的AI互動產(chǎn)品,往往各自聚焦于某一種能力:有的擅長根據(jù)角色設(shè)定持續(xù)輸出符合人設(shè)的回應(yīng),有的通過長期文字交流建立陪伴感,也有的能夠識別語音中的情緒變化。但角色回應(yīng)、情緒識別和真實(shí)互動之間,往往還存在一定距離。
Soul的不同之處,在于嘗試把情緒感知、實(shí)時語音、數(shù)字表達(dá)和虛擬形象放進(jìn)同一個互動過程里。AI不只是識別情緒或生成一句符合預(yù)期的話,而是結(jié)合對話語境、語氣變化和互動歷史作出回應(yīng),讓聲音、表情和語言等多模態(tài)共同參與交流,使互動更接近人與人之間自然發(fā)生的對話。
除了數(shù)字人,Soul還在WAIC 2026現(xiàn)場首次亮相了公司第一款A(yù)I硬件B Soul。這款定位AI硬件的便攜式設(shè)備,將自研大模型SoulX的語音交互、情感表達(dá)和數(shù)字生命能力融入其中。用戶可以通過配套的軟件自定義角色的名稱、性別、關(guān)系、聲音等,角色接入記憶體后能記住與用戶的交互內(nèi)容。這標(biāo)志著Soul的能力正從手機(jī)屏幕走向現(xiàn)實(shí)的物理空間。
![]()
當(dāng)模型長在場景里
在B Soul之中,核心的能力來自Soul自研大模型SoulX,而SoulX的定位很明確:基于情緒感知、語音為先、面向多模態(tài)的交互大模型。區(qū)別于通用大模型什么都能答的路線,Soul選擇了一條更聚焦但也更深的路徑:專注情緒感知與交互。
這個選擇是基于多年深耕行業(yè)的經(jīng)驗(yàn)而做出的。成立于2016年的Soul,沒有采用當(dāng)時主流社交產(chǎn)品圍繞真實(shí)照片和地理位置做匹配的模式,而選擇了一條不同的路:用戶以虛擬形象出現(xiàn),由算法根據(jù)興趣、性格和社交偏好完成連接。當(dāng)時,AI雖然尚未成為產(chǎn)品主角,卻已經(jīng)承擔(dān)起撮合者的角色。
2020年前后,Soul啟動了AIGC技術(shù)研發(fā),圍繞情緒感知和交互方向探索自研模型SoulX。如今,Soul已構(gòu)建了包括語音生成、歌聲生成、語音轉(zhuǎn)換、多說話人轉(zhuǎn)錄、雙工實(shí)時交互、實(shí)時數(shù)字人生成在內(nèi)的核心能力體系,覆蓋語音理解、語音生成、情感表達(dá)、交互控制和多模態(tài)呈現(xiàn)等關(guān)鍵環(huán)節(jié)。
更重要的是,Soul的優(yōu)勢不僅在于單項(xiàng)模型能力,還在于已經(jīng)形成了“模型—產(chǎn)品—用戶—數(shù)據(jù)”的完整閉環(huán):模型在產(chǎn)品中被使用,用戶在使用中產(chǎn)生數(shù)據(jù),有效反饋推動模型迭代,優(yōu)化后的模型再進(jìn)入產(chǎn)品。每一輪循環(huán),模型對情緒的理解就更精確一層。這不是一個可以從外部復(fù)制的優(yōu)勢,因?yàn)樗钠瘘c(diǎn)是一個已經(jīng)運(yùn)轉(zhuǎn)了多年的社交平臺,而非一張白紙。
2024年全球人工智能市場規(guī)模近2800億美元,2025年達(dá)7575.8億美元,預(yù)計2026年將突破9000億美元。AI落地具體的產(chǎn)業(yè)鏈,形成更大的市場空間已經(jīng)成為大趨勢,但在融入具體的場景中,大多數(shù)產(chǎn)品的留存率和商業(yè)模式仍不穩(wěn)固。一個閉環(huán)運(yùn)轉(zhuǎn)的系統(tǒng)能做到的,恰恰是那些單點(diǎn)產(chǎn)品做不到的事:持續(xù)迭代、持續(xù)積累、持續(xù)加深對用戶的理解。
Soul App聯(lián)合中國青年報發(fā)布的《2025年大學(xué)生AI使用行為與心態(tài)洞察報告》給出了另一個維度的佐證:超九成受訪大學(xué)生已接入AI服務(wù),年輕一代對AI交互的心理門檻正在快速降低,他們需要的不是一個更聰明的問答機(jī)器,而是一個能“接住”他們情緒的對象。而能接住情緒的前提,是先理解情緒,理解情緒的前提,是有足夠多的場景去觀察情緒。這就是閉環(huán)的價值。
數(shù)據(jù)可以說明Soul閉環(huán)的運(yùn)轉(zhuǎn)效率:Soul目前已有460萬用戶日常使用AI功能,約占整體日活的40%。這意味著,每天有近一半的活躍用戶在跟AI交互,在具體的場景中,指導(dǎo)模型有效迭代,創(chuàng)造實(shí)際的用戶價值。
![]()
不止于社交
從一款應(yīng)用到整體生態(tài)的建設(shè),Soul正在將實(shí)時語音、數(shù)字人、內(nèi)容演繹和情緒交互能力,從Soul App延伸至AI硬件及To B產(chǎn)業(yè)場景。Soul的定位已從社交平臺升級為模型與應(yīng)用一體化的AI生態(tài)公司。
SoulX自研模型體系已形成差異化互補(bǔ)的模型矩陣。例如,實(shí)時數(shù)字人方向,SoulX-FlashHead主打輕量化、低成本,適配消費(fèi)級硬件,單卡RTX 4090即可實(shí)現(xiàn)96FPS流式推理,僅需6.4G顯存;SoulX-FlashTalk主打高幀率、低延時,適配實(shí)時直播場景;SoulX-LiveAct主打全身動作、小時級穩(wěn)定,適配長期在線復(fù)雜場景。三款模型覆蓋不同硬件條件和性能要求,滿足開發(fā)者的差異化生成需求。
例如,SoulX系列可應(yīng)用于電商AI直播、短視頻制作、AI教育、NPC交互、AI客服等領(lǐng)域,現(xiàn)階段,也正面向具身智能、內(nèi)容演繹等行業(yè)輸出情緒感知與交互決策方案。這意味著,SoulX不再只在Soul App里服務(wù)社交用戶,它開始進(jìn)入更廣闊的商業(yè)世界。
據(jù)了解,2026年下半年,Soul計劃在國內(nèi)市場為企業(yè)與開發(fā)者提供更豐富的一站式多模態(tài)交互能力服務(wù),包括面向內(nèi)容演繹領(lǐng)域輸出解決方案,涵蓋有聲小說、AI漫劇、AI播客等方向。同時基于IP音色和交互技術(shù),面向智能硬件終端提供服務(wù)。
這意味著Soul的商業(yè)模式正在從單一的C端社交服務(wù),向B端產(chǎn)業(yè)解決方案延伸。它不再只是一家社交軟件公司,而是正成為一家模型與應(yīng)用一體化的AI生態(tài)公司。
在這樣的市場背景下,一家擁有社交場景、數(shù)據(jù)閉環(huán)和模型能力的公司,輸出能力、擴(kuò)展場景、建設(shè)生態(tài),是從“做好一個產(chǎn)品”到“定義一個行業(yè)”的必經(jīng)之路。
不僅于此,據(jù)悉Soul預(yù)計于2027年啟動海外市場拓展,優(yōu)先圍繞語音生成、實(shí)時交互及內(nèi)容演繹等能力推出面向海外市場的產(chǎn)品和服務(wù)。這一步意味著,閉環(huán)的邊界將從中國市場擴(kuò)展到全球,SoulX的賽道也將從國內(nèi)社交延伸到國際AI語音與人機(jī)交互市場。
此前,Soul AI團(tuán)隊已開源了語音合成模型SoulX-Podcast,該模型發(fā)布后快速登頂HuggingFace TTS趨勢榜,目前在GitHub上擁有超3500星標(biāo)。此外,團(tuán)隊還開源了歌聲合成模型SoulX-Singer、全雙工語音對話控制模塊SoulX-Duplug、端到端多人對話轉(zhuǎn)錄模型SoulX-Transcriber,以及實(shí)時數(shù)字人方向的SoulX-LiveAct、SoulX-FlashTalk、SoulX-FlashHead等模型。開源是生態(tài)建設(shè)的杠桿:讓更多開發(fā)者用你的模型,就有更多人依賴你的基礎(chǔ)設(shè)施,就有更多場景推動模型優(yōu)化迭代。
Soul 團(tuán)隊在交互方向的技術(shù)基建已經(jīng)形成了完整的鏈路:語音理解、語音生成、情感表達(dá)、交互控制、多模態(tài)呈現(xiàn),每一個環(huán)節(jié)都有對應(yīng)的模型或模塊。這不是碎片化的技術(shù)展示,而是系統(tǒng)化的能力底座。一個“模型與應(yīng)用一體化”的定位,需要的就是這種從底層到場景的貫通,而不是只有幾個亮眼的單點(diǎn)。
AI交互的終局不是讓機(jī)器變得更聰明,而是讓機(jī)器能感知、接住、回應(yīng)情緒,從而讓AI具備“活人感”。Soul正在用一套“模型-應(yīng)用-場景-數(shù)據(jù)”的完整閉環(huán),試圖回答一個更大的問題:當(dāng)AI真正學(xué)會理解人的時候,人與AI的交互范式會變成什么樣子?
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.