編輯|Sia
在今天的 WAIC 現(xiàn)場,學(xué)習(xí)已經(jīng)變成醬嬸兒了:
拍題不搞「劇透」,AI 先追問你依據(jù)是什么?
寫作文不請「槍手」,反倒教你怎么「化妝」;
還能一鍵穿越,和「孔子」坐而論道......
沒錯,首次參展的 AI 原生企業(yè)與愛為舞,直接把一座開放式「AI 學(xué)習(xí)實驗室」搬進了世博展覽館 H2-E505 展位。
沒有大屏循環(huán)播片,也不是觀眾站一圈看完就走。你是真的能坐下來,親手一試:學(xué)習(xí)這件事,確實換了個打開方式。
這也是今年 WAIC 最值得琢磨的變化之一。
去年,大家還在集體圍觀大模型、人形機器人、AI 終端。到了今年,問題更深入到這些 AI 應(yīng)用,到底有沒有真正走進生活?
展館里,垂直領(lǐng)域的專業(yè)智能體密集亮相,比拼工作流順不順、任務(wù)能不能跑起來、商業(yè)閉環(huán)到底有沒有。
教育與陪伴,成了觀察這場「務(wù)實躍遷」的最佳窗口。
畢竟,教育行業(yè)講了很多年因材施教,但真到了產(chǎn)品里,很多 AI 還是停在搜題、批改、生成講解。至于為什么一講就會、一做就錯,AI 沒真正看見。
現(xiàn)在,與愛為舞的學(xué)習(xí) Agent 開始撬動這個僵局。
學(xué)習(xí)這個事兒,終于換了個姿勢
在「愛學(xué) AI 學(xué)習(xí)智能體」體驗區(qū),我們先試了試「愛學(xué)拍講智能體」。
拍照搜題,都不陌生:拍一下,出答案,抄步驟,下一題。還能玩出什么花兒?
現(xiàn)場體驗下來,打開方式確實變了:「搜題即答案」,變成了「搜題即思路」。
隨手拍了一道初中幾何題。
![]()
系統(tǒng)很快識別出題目,接著智能體開始帶著我們推理。
先問:
∠1 + ∠2 = 180°,同時 ∠1 和 ∠DGE 也是鄰補角,也能湊成 180°。那 ∠2 和 ∠DGE 為什么相等?
我們故意含糊其辭:它們都和 ∠1 有關(guān)系。
智能體沒放過我們,繼續(xù)追問:
這個依據(jù)叫什么?
直到說出「同角的補角相等」這個知識點,它才繼續(xù)往下推進:
∠2 = ∠DGE,所以可以根據(jù)同位角相等推出 AB ∥ EG;
再利用平行線性質(zhì),得到 ∠3 = ∠ADE;
結(jié)合題目給出的 ∠3 = ∠B,通過等量代換推出 ∠ADE = ∠B;
最后根據(jù)同位角相等,兩直線平行,推出 DE ∥ BC。
![]()
過程中,為了不讓你走神兒,幾乎每隔一兩分鐘,每到一個推理節(jié)點、一個知識要點,智能體都會 cue 你——
答得對,繼續(xù)推進;答得模糊,追問依據(jù);答錯了,就降一階給提示,或者帶你回顧相關(guān)知識點。
講題,就這樣變成了一個可以交互、追問、糾錯的思維過程。
體驗完智能體如何講透一道題后,我們又上了一堂 AI 英語課:
一道題講得清楚,一節(jié)課也能 hold 住?
這是一堂英文寫作課,學(xué)習(xí)怎么潤色句子。
老師「 AI 心語」出現(xiàn)在屏幕右上角,很像真人,主區(qū)域則是一塊動態(tài)板書。
![]()
一句最樸素的英文句子放到黑板中央:
- A bird sat in the tree.
然后,「 AI 心語」帶著我給這句話「化妝」。
先在 tree 前加形容詞,比如 green,句子變成:
- A bird sat in the green tree.
再在動詞后加副詞,讓鳥兒坐得更具體;
繼續(xù)加介詞短語,補充這只鳥在哪里、來自哪里;
再加非謂語短語,寫出它當(dāng)時正在做什么;
最后加原因從句,把動作背后的理由也補上。
十幾分鐘后,一個低配句子,被一層層「補妝」,變成更完整、更有畫面感的表達。
![]()
這節(jié)課最不同的地方是,「 AI 心語」沒有一路自說自話。
我會被不斷 cue 到:填一個詞,補一個短語,判斷哪部分是形容詞、副詞,甚至來場 PK 小游戲。
而且,可以自由回答。
比如,我故意堅持用 sadly 描寫鳥兒狀態(tài),還反問:我覺得你的答案一點兒都不好,我就想用這個。
「 AI 心語」沒有直接判錯。
先肯定這個想法有自己的特點,再提醒題目希望使用更陽光、正向的詞匯,隨后把話題拉回「副詞修飾動詞」這個知識點。
我又故意說:哎呀,不記得你剛才講什么了。或者,什么是非謂語動詞呀?
她又會停下來重復(fù)或者解釋,再把課堂節(jié)奏接回去。
更有意思的是,沒有預(yù)制 PPT,「 AI 心語」會根據(jù)互動內(nèi)容,現(xiàn)場板書。
需要填空的地方,會被標(biāo)出來:
![]()
我的回答也會出現(xiàn)在板書上,并被高亮:
![]()
答錯了,錯誤答案會被劃掉;該給提示時,線索也會適時彈出來。
![]()
一節(jié)課下來,角色反轉(zhuǎn):
- 學(xué)員被推到了 C 位:要開口,要選擇,要判斷,要犯錯,也要把自己的思路暴露出來。
- AI 成了陪練:追問、提示、糾偏,帶著你一步步往前走。
而當(dāng)我們轉(zhuǎn)頭和大屏上的「孔子」對話時,立馬感覺穿越了。
屏幕里是一間古色古香的書齋。竹簡、木案、舊墻、素色衣袍,一個長髯垂胸的孔子數(shù)字人站在中央。
![]()
https://mp.weixin.qq.com/s/U9CbR5dS_peZ-SzToK7G6A
他一開口,就有點穿越:
「今逢后世二零二六年……」
我們問他:如果看到今天 AI 的發(fā)展,未來學(xué)習(xí)會變成什么樣?
孔子微微停頓,很快接上:
吾昔倡有教無類,因材施教,今此智能體,正可彌資源之壑,順學(xué)子之性,令學(xué)皆得其所宜,人人皆能樂學(xué)善知,汝以為此智器于蒙童之教,最可補今之弊。
措辭、語氣、眼神、表情都撐住了,微微頷首、抱拳作揖這些小動作也很自然。一時間,真有點忘了自己面對的是 AI 。
幾輪對話下來,AI 教育里常說的個性化學(xué)習(xí)、因材施教,被放回孔子的語境里,突然有了跨時空的回聲。原來,傳統(tǒng)知識也可以變成一個可對話、可進入的現(xiàn)場。
從給答案到會教人,中間差了一個自研「大腦」
幾輪體驗下來,最值得注意的并不是某個功能有多炫,而是同一個變化反復(fù)出現(xiàn):
AI 開始知道,學(xué)生給出反饋之后,下一步該怎么走。
這正是 AI 教育最難的地方。
過去很多產(chǎn)品解決的是有沒有答案、講解夠不夠完整。但真實學(xué)習(xí)里,更關(guān)鍵的問題常常發(fā)生在答案之外:
學(xué)生為什么卡住?這個回答算不算真懂?現(xiàn)在該繼續(xù)追問,還是換一種提示?該把知識點拆細(xì),還是讓學(xué)生自己再試一次?
這些判斷,過去屬于資深教師的隱形經(jīng)驗。現(xiàn)在,愛學(xué)試圖把它變成模型能力。
這也是愛學(xué)大模型在整套學(xué)習(xí) Agent 里的位置。它并不只是負(fù)責(zé)生成一段講解,而是承擔(dān)教學(xué)決策中樞的角色:
先識別學(xué)生狀態(tài),再判斷下一步策略,最后把策略落到語言、板書、互動節(jié)奏和課堂流程里。
拍講智能體里,這一點最直觀。
同樣是拍一道題,普通搜題產(chǎn)品會把答案和步驟直接攤出來。「愛學(xué)拍講智能體」沒有急著「劇透」,而是先追問,依據(jù)是什么。學(xué)生答得含糊,它繼續(xù)追問;答到關(guān)鍵知識點,才推進下一步。
看似只是多問了一句,背后其實是教學(xué)邏輯的變化。
它要判斷學(xué)生此刻缺的是知識點還是表達;也要判斷什么時候該提示,什么時候該停下來讓學(xué)生自己說。拍講從「結(jié)果導(dǎo)向」變成「過程導(dǎo)向」,學(xué)習(xí)才有可能真正發(fā)生。
英語寫作課上,也是如此。
當(dāng)我們故意用 sadly 描寫鳥兒狀態(tài)時,「 AI 心語」沒有直接判錯,也沒有簡單給出標(biāo)準(zhǔn)答案。
它先接住這個表達,再把話題拉回「副詞修飾動詞」和寫作語境。這種處理,比單純糾錯更接近真實老師的反應(yīng)。
再往下看,動態(tài)板書也不只是視覺效果。
過去很多在線課堂的板書,本質(zhì)上還是預(yù)制 PPT 。講到哪一頁,播到哪一步。學(xué)生回答錯了,板書不會真的「看見」這個錯誤。
這次不一樣。
在寫作課里,學(xué)生填出的詞會出現(xiàn)在畫面上,錯誤答案會被劃掉,關(guān)鍵位置會被標(biāo)注,線索提示也會適時彈出。板書開始跟著學(xué)生反饋變化。
這意味著,模型輸出的不只是「說什么」,還包括畫什么、標(biāo)哪里、什么時候擦掉、什么時候提示。教學(xué)思路被實時攤開,學(xué)生也能看到自己的思考過程如何被修正。
再進一步,是課堂節(jié)奏。
真正的課堂不會按腳本一路播放。學(xué)生可能回答說「不記得了」、「什么是非謂語動詞」、甚至挑戰(zhàn)所謂的標(biāo)準(zhǔn)回答。
這時,AI 要判斷這句話是提問、跑題,還是沒聽懂;接下來要重復(fù)、解釋、推進,還是降階講。
能不能接住這些變化,才是學(xué)習(xí) Agent 和普通問答工具的分水嶺。
所以,愛學(xué)大模型背后的技術(shù)重點,并不在于把一個大模型套進教育場景,而是把教學(xué)拆成一連串可感知、可判斷、可執(zhí)行的動作。
為此,愛學(xué)大模型吃進了大量真實課堂里的教學(xué)因果鏈。學(xué)生怎么答,老師怎么接,哪種追問有效,哪種提示會直接泄題,這些都要被持續(xù)訓(xùn)練和校準(zhǔn)。
同時,它還搭了一套雙重評測體系。
一邊盯指令遵循,確保不透題、不跑偏;一邊用更強模型和教研標(biāo)準(zhǔn)評估回答質(zhì)量,看它是不是語氣自然、簡潔明了、邏輯連貫、針對性強。
這套體系帶來的結(jié)果,是愛學(xué)大模型的指令遵循穩(wěn)定在 99% 以上——我們體驗過的「追問依據(jù)叫什么」、「先肯定 sadly 修飾鳥兒的創(chuàng)意,再糾正語義方向」,背后都是這套機制的功勞。
對錯判斷變得更準(zhǔn),線上 badcase 率也大幅下降。
不過,如果只做到這里,它仍然只是一個「此刻很會教」的系統(tǒng)。
真正讓它更像學(xué)習(xí) Agent 的是,自我進化。
為此,愛學(xué)還設(shè)計了一套數(shù)據(jù)飛輪。
- 線下小飛輪(安全試錯):在上線前,讓模型在基于合成數(shù)據(jù)的虛擬課堂里反復(fù)「翻車」、反復(fù)修正,完成冷啟動和基礎(chǔ)策略迭代。
- 線上大飛輪(實戰(zhàn)進化):捕捉真實學(xué)生的每一次停頓、沉默、打斷和錯誤。這些行為變成了強化學(xué)習(xí)的「反饋信號」,轉(zhuǎn)化為新的教學(xué)技能( Skill ),通過沙箱驗證后再反哺給線上模型。
至此,學(xué)習(xí) Agent 完成閉環(huán):懂學(xué)生,做決策,執(zhí)行教學(xué)動作,再從真實反饋里長出新的教學(xué)能力。
這也是 AI 教育最值得關(guān)注的范式變化。
多模態(tài)加持:大腦有了,身體也得跟上
學(xué)習(xí)智能體光有一顆「大腦」,還不夠。
它要真正進入學(xué)習(xí)現(xiàn)場,還得能聽、能說、能看、能呈現(xiàn)。
這就是多模態(tài)身體的價值。
數(shù)字人讓 AI 有了形象;語音讓它聽得清、接得住;多模態(tài)生成則把知識從課本里拎出來,變成可對話、可進入的現(xiàn)場。
先看最直觀的數(shù)字人。
在教育場景里,數(shù)字人不能只是一個會動的頭像。它要能講課、互動、轉(zhuǎn)場、接話,還要撐住一整節(jié)課。
這件事并不輕松。
過去做高精度 3D 數(shù)字人,多少有點「棚拍工程」的味道。多視角采集、相機標(biāo)定、復(fù)雜制作流程,一個都少不了。門檻高,周期長,成本也下不來。
愛學(xué)押注 3D 高斯路線,直接啃掉了兩塊硬骨頭。
一個是更容易做出來。
愛學(xué)提出的 AnyAvatar 算法瞄準(zhǔn)的是一個長期制約高質(zhì)量數(shù)字人落地的核心問題:如何在相機未經(jīng)專業(yè)標(biāo)定、拍攝條件不受嚴(yán)格控制的環(huán)境下,快速構(gòu)建高保真的 3D 高斯頭部數(shù)字人。
傳統(tǒng)方案高度依賴精確的相機內(nèi)外參數(shù),輕微的位姿誤差都會導(dǎo)致面部幾何錯位、紋理漂移和跨視角不一致,AnyAvatar 將這一流程重構(gòu)為統(tǒng)一的自校準(zhǔn)建模框架:
系統(tǒng)首先利用通用模型預(yù)測粗略相機位姿,再通過可行性引導(dǎo)的 FLAME 初始化定位合理的頭部空間,并將相機位姿、FLAME 參數(shù)和 3D Gaussian 屬性放入同一優(yōu)化框架聯(lián)合求解,在過程中持續(xù)修正相機誤差。
簡單來說,過去構(gòu)建高質(zhì)量數(shù)字人依賴「準(zhǔn)確的相機」,而 AnyAvatar 則讓系統(tǒng)具備了「自動校正相機」的能力,將拍攝幾何、人臉先驗和神經(jīng)渲染統(tǒng)一到同一套優(yōu)化體系中,使高保真數(shù)字人建模從專業(yè)攝影棚走向真實場景下的自動化生產(chǎn)。
最后落到產(chǎn)品上,就是門檻被打了下來。這項技術(shù)也已入選 ACM Multimedia 2026 。
另一塊硬骨頭,是長時間互動不出戲。
短視頻里臉偶爾飄一下,用戶可能劃走就算了。但一節(jié) AI 課里,學(xué)生會一直看著老師。臉崩、口型飄、表情僵,沉浸感立刻掉線。
愛學(xué)提出的 MoGaFace 算法瞄準(zhǔn)的正是這個問題。
它要解決 3D 高斯數(shù)字人里更細(xì)、更致命的質(zhì)量問題:人臉幾何錯位、紋理模糊、跨視角表情不一致。最終落到觀感上,就是老師轉(zhuǎn)頭、講解、表情變化時,臉部結(jié)構(gòu)更穩(wěn),皮膚紋理更清楚,動態(tài)表情也更連貫。
更現(xiàn)實的是成本。
據(jù)介紹,導(dǎo)師資產(chǎn)前期單獨建模,建好之后可以反復(fù)驅(qū)動調(diào)用;推理和渲染成本壓下來后,消費級 GPU 就能流暢運行。
這意味著,高保真數(shù)字人不再只適合展臺炫技,也有機會真正進入長期在線課堂。
但有形象還不夠。AI 進入學(xué)習(xí)現(xiàn)場,第一道門檻其實是「聽」。
展會現(xiàn)場很吵,旁邊有人說話、混合著嘈雜的背景音在一起。「 AI 聲紋降噪」體驗區(qū)展示的,就是在這種復(fù)雜環(huán)境里,把非目標(biāo)人聲和背景噪音都成功過濾掉,只保留干凈清晰目標(biāo)人聲。
![]()
https://mp.weixin.qq.com/s/U9CbR5dS_peZ-SzToK7G6A
與「先降噪、再分離、再識別」的多模塊拼接不同,愛學(xué)把「這是誰的聲音」與「降噪增強」合到一起訓(xùn)練的端到端模型,從底層避免模塊間的精度損耗。實測目標(biāo)人聲語音召回率 97%、精準(zhǔn)率 98%,信噪比提升超過 15dB,降噪深度(降噪前后 delta 收益)達到40dB。此外,聲紋注冊門檻也已從 20 秒降到約10 秒。
這聽起來像是一個音頻處理技術(shù),但是對于教育又非常關(guān)鍵,因為如果多人聲同時進入教學(xué) Agent,學(xué)習(xí)就無法正常進行了。
AI 一旦聽錯,后面的追問、糾錯、評價全都會跑偏。尤其在低齡學(xué)習(xí)場景里,孩子說話慢、停頓多、表達不完整,系統(tǒng)既不能搶話,也不能把旁人的聲音當(dāng)成學(xué)生回答。
最后,是多模態(tài)生成。
如果數(shù)字人和語音解決的是 AI 如何進入學(xué)習(xí)現(xiàn)場,那么多模態(tài)生成解決的,就是知識怎么從課本里走出來。
數(shù)字「孔子」就是一個典型例子。
它的難點不只是讓孔子開口。更難的是,讓這個歷史文化人物在形象、神態(tài)、語氣、知識邊界和思想氣質(zhì)上都立得住。
為此,愛學(xué)在靜態(tài)上參考史料和經(jīng)典畫像,重塑五官、身型比例與春秋背景;在動態(tài)上塑造客觀、沉穩(wěn)、莊重又帶有豁達感的神態(tài);更關(guān)鍵的是,結(jié)合典籍中的孔子言行,用愛學(xué)大模型為他構(gòu)建一套穩(wěn)定的精神內(nèi)核。
所以,用戶面對的不是一個古風(fēng)對口型頭像,而是一個可以持續(xù)追問、持續(xù)對話的文化人格 Agent。
名畫復(fù)原,也是類似邏輯。
愛學(xué)用自研 AI 短視頻生成框架,把畫作拆成故事線、場景、鏡頭和交互節(jié)點,讓《清明上河圖》、《千里江山圖》變成可以第一視角走入的歷史現(xiàn)場。
從「能演示」到「能交付」,全靠一副萬人并發(fā)的鋼筋骨架
前面講的,是學(xué)習(xí) Agent 怎么會教、怎么聽、怎么說、怎么把課堂變成現(xiàn)場。
但真正落到產(chǎn)品里,還有一個更硬的問題:
這么復(fù)雜的一套系統(tǒng),數(shù)萬人同時在線時,還能不能跑得穩(wěn)、接得住、答得快?
這一步,決定它到底是展臺 Demo,還是能長期交付的產(chǎn)品。
一方面,AI 課堂的鏈路本來就長。
學(xué)生開口后,背后要經(jīng)過語音識別、語言模型推理、語音合成、數(shù)字人驅(qū)動、音視頻推流等多個環(huán)節(jié)。每一環(huán)都可能帶來延遲,每一環(huán)都可能出錯。
更麻煩的是,真實課堂不是標(biāo)準(zhǔn)流水線。
一萬名學(xué)生,就有一萬條學(xué)習(xí)進度、一萬段上下文、一萬個實時變化的課堂狀態(tài)。有人卡在非謂語短語,有人正在追問,有人突然打斷,有人中途退出,幾分鐘后又回來。
系統(tǒng)既要把延遲壓到幾乎無感,又要記住每個人學(xué)到了哪一步。回來之后,不能從頭尬聊,還得接著剛才的地方繼續(xù)。
所以,愛學(xué)硬拼的,還包括這層看不見的工程底座。
第一件事,是死磕首句延遲。
在大語言模型側(cè),愛學(xué)做了請求調(diào)度、安全審核和推理集群優(yōu)化,再結(jié)合 KV Cache、PrefixCaching 等機制提升吞吐。面向教學(xué)場景里的結(jié)構(gòu)化輸出,還專門做了解碼加速。
目的很直接:讓 AI 的第一句話盡快出來。
別小看這「第一句話」。課堂里,首句一慢,學(xué)生的注意力就掉了。
語音側(cè)也被拆開重做。
愛學(xué)把語音大模型里的 LLM 模塊和 Token2Wav 模塊分離部署,分別優(yōu)化穩(wěn)定性、首包速度、顯存管理和緩存復(fù)用。前者保證生成不亂,后者保證聲音盡快出來。
最終,語音大模型整體性能提升近 10 倍。即便疊加 ASR、語言模型、語音模型、數(shù)字人推理和音視頻推流,端到端延遲仍能控制在約 1.5 秒。
這就是 WAIC 現(xiàn)場「絲滑感」的來源。
但 AI 課堂只快還不夠。還得能恢復(fù)。
真實學(xué)習(xí)場景里,學(xué)生隨時可能退出、回來、打斷、跳步、答錯。系統(tǒng)如果丟了狀態(tài),AI 就只能重新寒暄,課堂節(jié)奏直接斷掉。
所以,愛學(xué)做了可重入設(shè)計。
它要能恢復(fù)學(xué)生當(dāng)前所處的知識點、教學(xué)目標(biāo)、互動歷史和下一步策略。中途走開再回來,智能體知道剛才講到了哪,也知道下一步該怎么接。
這點很關(guān)鍵。學(xué)習(xí) Agent 的連續(xù)性,靠的不是記住幾句聊天記錄,而是記住一整段教學(xué)狀態(tài)。
最后,還有一個容易被忽略的硬約束:安全上線。
學(xué)習(xí) Agent 會不斷更新模型、策略和 skill,但教育場景不能無約束試錯。新策略上線前,必須先經(jīng)過灰度、沙箱和安全校驗。否則一次錯誤提示、一次提前透題、一次不合適的反饋,都可能直接影響學(xué)生體驗。
講到這里,愛學(xué) AI 學(xué)習(xí)智能體的核心技術(shù)拼圖,基本完整了。
一顆自研大模型,負(fù)責(zé)「因材施教」決策;
一副多模態(tài)身體,負(fù)責(zé)聽清學(xué)生、表達內(nèi)容、呈現(xiàn)知識;
一層工程底座,負(fù)責(zé)把這套復(fù)雜鏈路穩(wěn)定跑在真實課堂里;
這些事情合在一起,才讓每個人的 WAIC 現(xiàn)場體驗得以成立。
7 月 17 日至 20 日,世界人工智能大會世博展覽館 H2-E505。歡迎親自走進「與愛為舞愛學(xué) AI 學(xué)習(xí)實驗室」,去見證,去感知。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.