AI 圈最近又熱了一個(gè)詞:Loop Engineering。
它原本出現(xiàn)在 AI Agent 語(yǔ)境里,講的是一件很直接的事:別再只盯著單次 prompt,而要設(shè)計(jì)一套能持續(xù)運(yùn)行的閉環(huán)系統(tǒng)。系統(tǒng)接任務(wù)、調(diào)工具、看結(jié)果、發(fā)現(xiàn)問(wèn)題、再修正,直到目標(biāo)被推進(jìn)完成。換句話說(shuō),AI 工程的重心正在從 prompt-centric 轉(zhuǎn)向 workflow-centric。
放到機(jī)器人里,這個(gè)問(wèn)題會(huì)被進(jìn)一步放大。軟件里的 loop 面對(duì)的是代碼、接口、日志和工具調(diào)用;機(jī)器人里的 loop 面對(duì)的是真實(shí)世界:視覺(jué)誤差、動(dòng)作控制、身體反饋、環(huán)境變化,以及隨時(shí)可能發(fā)生的失敗。
這也是 Loop Engineering 之所以重要的原因:真正可擴(kuò)展的智能,不是一次性給出答案,而是在反饋中不斷逼近正確結(jié)果。
人類本來(lái)就是最成熟的閉環(huán)系統(tǒng)
![]()
人類完成一個(gè)動(dòng)作,本身就是持續(xù)閉環(huán)。
眼睛鎖定目標(biāo),大腦結(jié)合上下文形成意圖,神經(jīng)系統(tǒng)把意圖下發(fā)到肌肉,肌肉開(kāi)始執(zhí)行;與此同時(shí),視覺(jué)、本體感覺(jué)、觸覺(jué)和誤差信號(hào)持續(xù)回流,幫助我們實(shí)時(shí)修正軌跡、力度和姿態(tài)。
也就是說(shuō),人類始終在「感知 — 決策 — 執(zhí)行 — 反饋 — 修正」的環(huán)路里和世界打交道。
這也解釋了為什么具身智能正在爭(zhēng)搶 ego-centric、human-centric 數(shù)據(jù)。真機(jī)數(shù)據(jù)貴,機(jī)器人采集慢,真實(shí)世界交互復(fù)雜;相比之下,人類第一視角數(shù)據(jù)更容易規(guī)模化,也更接近真實(shí)任務(wù)場(chǎng)景。
但今天大多數(shù) human-centric 數(shù)據(jù),記錄的仍然主要是「人做了什么」。對(duì)真正的閉環(huán)智能來(lái)說(shuō),更關(guān)鍵的是:人為什么這樣做?準(zhǔn)備怎么做?做到哪一步?又如何根據(jù)反饋修正?
這正是一家名為臉譜心智的初創(chuàng)公司試圖切入的位置。
從世界模型架構(gòu),到數(shù)據(jù)范式
臉譜心智 Facemind 由雙 95 后博士陸弘遠(yuǎn)及韋怡然創(chuàng)立,早期從端側(cè)全模態(tài)模型切入,隨后將重心轉(zhuǎn)向更底層的世界模型研究。
他們最近在世界模型方向做了一次架構(gòu)創(chuàng)新,發(fā)布了 Looped World Models。
論文鏈接:https://arxiv.org/abs/2606.18208
據(jù)其介紹,這是世界首個(gè)基于 loop transformer 的世界模型。它的核心思路,是通過(guò)參數(shù)共享的 transformer block,對(duì) latent state 進(jìn)行迭代式 refinement,讓模型在內(nèi)部多輪滾動(dòng)、修正,逼近更穩(wěn)定的狀態(tài)理解。
![]()
這相當(dāng)于把 loop 引入世界模型架構(gòu)層面:模型不是一次性理解環(huán)境,而是在隱藏狀態(tài)中反復(fù)更新對(duì)環(huán)境和動(dòng)力學(xué)的判斷。
LoopWM 在 ego-centric、human-centric 數(shù)據(jù)上體現(xiàn)出非常強(qiáng)的 data efficiency 和 performance。
但這也帶來(lái)了一個(gè)更進(jìn)一步的問(wèn)題:數(shù)據(jù)側(cè)還有沒(méi)有可能繼續(xù)升級(jí)?
今天大多數(shù) Ego 數(shù)據(jù),仍然主要記錄人看到了什么、做了什么。它能覆蓋大量真實(shí)場(chǎng)景,也能提供豐富的人類操作樣本,但它對(duì)「動(dòng)作為什么這樣發(fā)生」這件事,記錄得還不夠完整。
一個(gè)動(dòng)作并不是從畫(huà)面直接跳到結(jié)果。它中間還包括目標(biāo)鎖定、動(dòng)作準(zhǔn)備、意圖形成、肌肉執(zhí)行、反饋感知和實(shí)時(shí)修正。如果這些過(guò)程沒(méi)有被記錄下來(lái),模型學(xué)到的就更接近動(dòng)作結(jié)果或行為軌跡;如果這些過(guò)程能被同步采集、對(duì)齊并結(jié)構(gòu)化,模型才有機(jī)會(huì)學(xué)習(xí)動(dòng)作背后的閉環(huán)策略。
于是,問(wèn)題從模型架構(gòu)轉(zhuǎn)向了數(shù)據(jù)范式:在現(xiàn)有 ego-centric、human-centric 數(shù)據(jù)之外,能不能進(jìn)一步采到更優(yōu)質(zhì)、更閉環(huán)的操作數(shù)據(jù)?
臉譜心智給出的答案,就是接下來(lái)要講的這套新的數(shù)據(jù)范式。
數(shù)據(jù)范式 Ego-NeuroLoop:把人類閉環(huán)變成訓(xùn)練資產(chǎn)
這套數(shù)據(jù)范式,叫 Ego-NeuroLoop。
它要采的不只是人手最后做了什么動(dòng)作,而是一組圍繞人類操作過(guò)程展開(kāi)的多模態(tài)閉環(huán)數(shù)據(jù)。
具體來(lái)說(shuō),數(shù)據(jù)使用 world camera 捕捉人與環(huán)境交互的視覺(jué)上下文,記錄環(huán)境里有什么、物體在哪里、動(dòng)作發(fā)生在什么場(chǎng)景中;使用 gaze 捕捉人的視線和注意力落點(diǎn),記錄目標(biāo)是如何被發(fā)現(xiàn)、鎖定和持續(xù)關(guān)注的;用 EEG 捕捉與動(dòng)作意圖、狀態(tài)切換、誤差感知相關(guān)的神經(jīng)層信號(hào),幫助判斷人什么時(shí)候準(zhǔn)備動(dòng)作、什么時(shí)候意識(shí)到偏差;最后用 sEMG 捕捉肌肉激活和發(fā)力變化。
普通 egocentric data 主要記錄「人看到了什么、手做了什么、任務(wù)有沒(méi)有完成」。Ego-NeuroLoop 則進(jìn)一步把這些信號(hào)放到同一條時(shí)間軸上,把動(dòng)作拆成一條連續(xù)的閉環(huán)鏈路:視覺(jué)告訴系統(tǒng)世界狀態(tài),視線告訴系統(tǒng)目標(biāo)在哪里,EEG 提供注意力,意圖和狀態(tài)變化線索,sEMG 提供執(zhí)行和發(fā)力線索,多模態(tài)反饋共同解釋人如何在操作中不斷修正。
如果說(shuō)普通第一視角視頻是在錄一部「動(dòng)作電影」,Ego-NeuroLoop 更像是在記錄一套人類閉環(huán)控制系統(tǒng)的運(yùn)行日志。它真正想變成訓(xùn)練資產(chǎn)的,是人類在真實(shí)操作中如何把事情一步步做對(duì)或者做錯(cuò)修正的過(guò)程數(shù)據(jù)。
![]()
數(shù)據(jù)采集 NeuroMatrix:低成本采下關(guān)鍵閉環(huán)信號(hào)
第一層是數(shù)據(jù)采集裝置 NeuroMatrix,負(fù)責(zé)把視覺(jué)、視線、EEG、sEMG 等多模態(tài)信號(hào)采下來(lái)。NeuroMatrix 的核心設(shè)計(jì)邏輯,是先用高精度版本采集 EEG、sEMG 數(shù)據(jù)訓(xùn)練基座模型,建立人類動(dòng)作意圖、神經(jīng)信號(hào)和肌肉執(zhí)行之間的對(duì)應(yīng)關(guān)系。
![]()
有了這張「人類閉環(huán)」的信號(hào)地圖,系統(tǒng)就能進(jìn)一步找到與手臂、手指動(dòng)作高度相關(guān)的腦區(qū)信號(hào)、頭皮電極通道,以及相關(guān)肌肉區(qū)域。隨后,量產(chǎn)硬件設(shè)計(jì)圍繞關(guān)鍵位置收縮:減少電極數(shù)量,壓縮傳感器點(diǎn)位,把采集裝置做成更低成本、更可部署的形態(tài)。
這一步解決的是采集半徑和采集成本問(wèn)題。它把原本高門(mén)檻,價(jià)值數(shù)十萬(wàn)的人類閉環(huán)采集能力,推向數(shù)千元級(jí)目標(biāo)區(qū)間,也讓過(guò)去只有少數(shù)實(shí)驗(yàn)室和大團(tuán)隊(duì)才能負(fù)擔(dān)的數(shù)據(jù)生產(chǎn)能力,變得更可擴(kuò)展、更高頻、更貼近真實(shí)世界。
數(shù)據(jù)增強(qiáng) NeuroBooster:神經(jīng)信號(hào)的 VLM
第二層是多模態(tài)基座模型 NeuroBooster。它可以理解為「神經(jīng)信號(hào)的 VLM」。VLM 解決圖像和文本之間的對(duì)齊問(wèn)題,NeuroBooster 解決視覺(jué)、視線、EEG、sEMG 之間的對(duì)齊、配對(duì)、映射和增強(qiáng)重建問(wèn)題。
NeuroMatrix 把多模態(tài)信號(hào)采上來(lái)之后,下一步進(jìn)入 NeuroBooster。
如果說(shuō) VLM 把圖像和文本映射到統(tǒng)一表征空間里,讓模型理解「一張圖對(duì)應(yīng)什么語(yǔ)義」,那么 NeuroBooster 要做的,就是把視覺(jué)、視線、EEG、sEMG 映射到統(tǒng)一閉環(huán)表征空間里,讓模型理解一個(gè)動(dòng)作如何從目標(biāo)、意圖、執(zhí)行到反饋修正一步步生成。
一個(gè)動(dòng)作發(fā)生時(shí),視覺(jué)里出現(xiàn)了什么目標(biāo),目光落在哪里,EEG 何時(shí)出現(xiàn)動(dòng)作準(zhǔn)備或狀態(tài)切換,sEMG 又如何對(duì)應(yīng)到手臂、手指的肌肉激活。NeuroBooster 通過(guò)多模態(tài)配對(duì)映射,把這些信號(hào)組織成一組可學(xué)習(xí)的閉環(huán)樣本。
它的訓(xùn)練路徑可以概括為三步:首先,基于 高精度 NeuroMatrix 前期形成的高精度信號(hào)地圖,學(xué)習(xí)不同模態(tài)之間的時(shí)間對(duì)齊關(guān)系和語(yǔ)義對(duì)應(yīng)關(guān)系;其次,圍繞手臂、手指動(dòng)作,建立腦區(qū)信號(hào)、頭皮電極通道、肌肉區(qū)域和視覺(jué)目標(biāo)區(qū)域之間的配對(duì)關(guān)系;最后,對(duì)低成本、低信噪比、多模態(tài)不同步的數(shù)據(jù)進(jìn)行增強(qiáng)重建,把粗糙采集結(jié)果轉(zhuǎn)成可被模型消費(fèi)的 Ego-NeuroLoop 數(shù)據(jù)。
這一步很關(guān)鍵,因?yàn)榈统杀驹O(shè)備天然會(huì)帶來(lái)噪聲。EEG 可能受到電極阻抗、接觸質(zhì)量、頭動(dòng)偽跡影響;sEMG 可能受到佩戴位置偏移、肌肉串?dāng)_和動(dòng)作噪聲影響;視覺(jué)數(shù)據(jù)可能出現(xiàn)遮擋、模糊和視角變化;gaze 數(shù)據(jù)也可能漂移或短時(shí)丟失。
NeuroBooster 的價(jià)值,就在于利用多模態(tài)之間的互補(bǔ)關(guān)系做增強(qiáng)重建:當(dāng) EEG 信號(hào)較弱時(shí),sEMG 和 gaze 可以補(bǔ)充動(dòng)作執(zhí)行與目標(biāo)信息;當(dāng) sEMG 存在噪聲時(shí),視覺(jué)和 EEG 可以提供動(dòng)作階段和意圖線索;當(dāng) gaze 漂移時(shí),world camera 和動(dòng)作狀態(tài)可以幫助恢復(fù)目標(biāo)上下文;當(dāng)視覺(jué)被遮擋時(shí),EEG 和 sEMG 可以補(bǔ)充動(dòng)作意圖與執(zhí)行狀態(tài)。
最終,模型看到的是一條經(jīng)過(guò)同步、對(duì)齊、配對(duì)映射、信號(hào)增強(qiáng)和結(jié)構(gòu)化處理的閉環(huán)時(shí)間軸:環(huán)境里有什么,目標(biāo)在哪里,意圖何時(shí)出現(xiàn),肌肉如何響應(yīng),動(dòng)作如何展開(kāi),反饋如何發(fā)生,下一步又如何修正。
這才是 Ego-NeuroLoop 真正想提供給具身智能模型的東西。
從數(shù)據(jù)資產(chǎn),到閉環(huán)策略
Ego-NeuroLoop 的價(jià)值,不是替代現(xiàn)有 ego-centric、human-centric 數(shù)據(jù),而是在它們之上補(bǔ)上更完整的閉環(huán)信號(hào)。
現(xiàn)有第一視角數(shù)據(jù)已經(jīng)很有價(jià)值。它提供真實(shí)場(chǎng)景、真實(shí)任務(wù)和真實(shí)人類行為,也讓世界模型能夠?qū)W習(xí)環(huán)境變化、動(dòng)作軌跡和結(jié)果反饋。
但如果進(jìn)一步加入視線、EEG、sEMG 等多模態(tài)信號(hào),數(shù)據(jù)就不再只是「人做了什么」,而是更接近「人為什么這樣做,以及如何在反饋中把事情做對(duì)」。
通過(guò) NeuroMatrix 和 NeuroBooster,低成本設(shè)備采集到的視覺(jué)、視線、EEG、sEMG 等多模態(tài)信號(hào),可以被映射成更穩(wěn)定的閉環(huán)語(yǔ)義。這給世界模型提供了更接近人類動(dòng)作生成過(guò)程的數(shù)據(jù):從環(huán)境感知,到目光鎖定目標(biāo),到神經(jīng)層狀態(tài)變化,再到肌肉執(zhí)行和反饋修正。
模型可以從這類數(shù)據(jù)里學(xué)習(xí):如何在復(fù)雜環(huán)境中鎖定真正相關(guān)的目標(biāo),如何在動(dòng)作發(fā)起前形成可執(zhí)行意圖,如何在執(zhí)行中依據(jù)反饋實(shí)時(shí)修正,如何在失敗時(shí)切換策略,避免機(jī)械重試。
這些能力需要目標(biāo)、意圖、執(zhí)行、反饋之間形成一條連續(xù)的環(huán)。這也是這套方案真正想采下來(lái)的東西:人類閉環(huán)策略。
最后
Loop Engineering 今天會(huì)火,是因?yàn)榇蠹医K于開(kāi)始認(rèn)真討論一個(gè)問(wèn)題:智能系統(tǒng)不能只會(huì)答,還得會(huì)跑、會(huì)驗(yàn)、會(huì)改。
但對(duì)具身智能來(lái)說(shuō),這個(gè)問(wèn)題還要再往前走一步。關(guān)鍵不只是把 AI 放進(jìn) loop,也不只是把現(xiàn)有第一視角數(shù)據(jù)用得更高效,而是能不能進(jìn)一步獲得更優(yōu)質(zhì)、更閉環(huán)的人類操作數(shù)據(jù)。
從這個(gè)角度看,臉譜心智提出 Ego-NeuroLoop,并做出 NeuroMatrix 和 NeuroBooster,真正想解決的是一個(gè)更底層的問(wèn)題:如果未來(lái)機(jī)器人要像人一樣理解世界、組織動(dòng)作、利用反饋、持續(xù)修正,那么訓(xùn)練數(shù)據(jù)能不能先把「人如何做到這一切」記錄清楚?
這條路線從世界模型架構(gòu)創(chuàng)新,走到了具身智能數(shù)據(jù)范式創(chuàng)新。
文章來(lái)源:機(jī)器之心。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.