作者 | 邱曉芬
編輯 | 袁斯來
硬氪獲悉,「眸深智能」(Motion Brain)完成近億元Pre-A輪追加融資,本輪投資方包括中國頭部物業服務公司、香港財團、多家上市公司聯合打造的產業投資平臺瑾悅投資、創合匯資本,以及老股東徐匯資本。
這也是繼2026年5月3億元Pre-A輪之后,「眸深智能」兩個月內再次獲得投資,此外,該公司Pre-A+輪的近5億融資也在交割當中。該公司透露,今年上半年以來,「眸深智能」的估值增長超10倍,是業內發展速度最快的具身大腦企業之一。
「眸深智能」成立于2025年1月,定位為全球最懂動作的自進化具身大腦公司,致力于"給10億臺機器人裝原生通用大腦"。
該公司由復旦大學深度學習實驗室主任陳濤教授、原英特爾中國首席科學家張益民博士,與連續創業者穆澤林共同創辦。核心團隊擁有海思、英特爾、英偉達三大芯片巨頭的背景人士,是國內少數具備算子級適配能力的具身大模型團隊。
盡管2025年才注冊成立,「眸深智能」的技術積累從2022年已經開始。在技術路線上,「眸深智能」選擇了一條與主流VLA(視覺-語言-動作)不同的路徑——以動作為核心的"世界動作模型"(World Motion Model)。
![]()
(圖源/企業)
從2022年起,「眸深智能」團隊已經發布了MLD(隱空間動作擴散模型)。在當時,行業主流是將動作視為離散的信號,導致生成的動作僵硬且缺乏多樣性,而「眸深智能」團隊在全球dede范圍內首次提出將動作映射到隱空間(Latent Space),并引入擴散模型(Diffusion Model)。
MLD相當于讓AI學會了“無師自通”地生成動作:不再需要逐幀教機器人如何走路,而是讓模型像畫家去噪一樣,從一團隨機噪聲中還原出自然、連貫的人體姿態。
如果說MLD解決了“怎么生成動作”,「眸深智能」又進一步著眼于如何“指揮動作”。2023年9月,團隊創造性發布了MotionGPT。類比漢字的基本筆畫,團隊將人體姿態拆解為約3000個“動作基元”。就像大語言模型(LLM)通過預測下一個token來生成句子一樣,MotionGPT通過預測下一個“動作token”來生成復雜行為。
這種將連續動作離散化的處理方式,不僅極大地提升了模型對長序列任務的理解能力,更重要的是,它讓機器人具備了Zero-Shot(零樣本)泛化能力——沒見過的動作指令,也能通過重組動作詞匯來理解并執行。這也是全球首個把動作做成token的具身大模型,發表于NeurIPS 2023。
到了2026年,團隊已經累計發布了7代模型,基于前述積累,「眸深智能」團隊又進一步推出了STI- WM(時空一體世界動作模型)具身大模型。
STI-WM時空一體世界動作模型是完全面向機器人長時序規劃、在線閉環控制、真實物理交互打造的原生具身智能框架,實現空間結構、時間演化、物理一致性、執行魯棒性四維一體化統一。
據介紹,STI-WM的核心突破在于,徹底擺脫了傳統VLA(視覺-語言-動作)模型對海量真機數據的重度依賴,采用了“80%互聯網視頻+10%動捕數據+10%真機數據”的訓練配方,并MotionGPT建立的動作詞典,從海量無標注的視頻中學習物理規律,再用少量動捕數據校準生物力學特征,最后僅用10%的真機數據完成閉環對齊。
也就是說,這種全新的數據訓練范式,將真機數據需求降低了90%,又將動作準確度提升至99%。
同時,「眸深智能」團隊又在今年3月提出的T2MB(Task*Task Motion Brain)也讓機器人具備了離線自進化能力,當模型部署到端側后,無需聯網回傳數據,僅憑本地交互就能持續優化性能,任務執行準確度最高提升25%,解決了機器人落地后發現bug必須返廠升級的痛點。
值得注意的是,英偉達DAIR實驗室在最新ARDY模型中,便援引了「眸深智能」的MLD與MotionGPT兩項原創技術——這是近兩年英偉達第三代動作模型對該公司技術路線的第四次引用。
不過,真正決定這套大腦能否規模化的,除了技術路線之外,還有端側算力成本,這也是「眸深智能」的一大競爭壁壘。據介紹,「眸深智能」從第一代模型起就同步推進兩個方向——模型壓縮與國產芯片適配。
一方面,通過模型蒸餾、冗余參數壓縮等工程化方案,「眸深智能」將千億參數級模型壓縮至百億級別,在具體場景中參數量降低約75%,端側推理延遲從約200毫秒降至10毫秒左右;另一方面,同步適配海思(昇騰310/910)、地平線、燧原(燧原S60)等國產芯片平臺,實現低功耗、高實時、超低成本的端側推理。
這套軟硬協同的打法,帶來的直接結果是,模型端側推理成本從20萬元降至1萬元,大腦續航時間提升10倍,而精度和性能卻不掉點。這一壓縮工作也幫助該團隊獲得了IJCAI 2025全球最佳論文獎,也是近五年唯一獲此獎項的中國大陸團隊。
依托這一能力,「眸深智能」可在兩周內完成一套具身大模型從一個本體到另一個本體的適配,包括復旦自研的“光華1號”、宇樹G1、上海人形機器人創新中心的“青龍”和“靈龍”等本體。
![]()
(圖源/企業)
「眸深智能」創始人、CEO穆澤林表示,國內具身智能行業普遍采用在國外芯片上訓練、再移植適配國產芯片的方案,性能損耗與兼容性問題突出,而「眸深智能」未來在模型訓練、推理全流程中將基于國產算力芯片原生開發,實現技術棧完全自主可控。
在商業化層面,「眸深智能」也是目前國內少數有營收的具身智能大腦公司。穆澤林告訴硬氪,其2025年審計回款收入千萬元,2026年上半年3000萬元,預計今年營收規模5000萬元以上。
目前,公司客戶覆蓋工業檢測、物業、環衛等場景。2026年第一季度,「眸深智能」已與某港股上市物業公司、A股上市環衛龍頭的機器人產品交付;正在推進與頭部連鎖零售集團、頭部白色家電工廠的人形機器人落地場景研發。
以下是硬氪與穆澤林的交流實錄(略經摘編)
硬氪:動作怎么變成Token?這是行業難點嗎?
穆澤林:確實是行業卡點。我們可以把動作理解為「數字化的姿態」:就像小人書的一頁是一個靜態姿勢,連續翻頁就成了動畫。我們早期通過幾十人團隊手工標注了幾萬個姿態,定義了3000多個基礎動作Token,類似漢字的3000個常用字,組合后能覆蓋人類所有行為。
更核心的是讓模型學習動作間的關聯:就像大語言模型通過學習海量文本掌握字詞排列規律,我們讓模型觀看百萬小時的互聯網視頻(影視劇、監控、Vlog等),學習「喝水時手會抬到嘴邊」「抱胸后大概率會展開手臂」這類動作因果邏輯。同時結合10%的動捕數據和10%的真機數據做校準,最終實現動作Token的端到端生成——支持從文本、圖片、3D點云到動作的轉化,也就是原生多模態能力。
硬氪:動作Token的組合會不會導致算力需求爆炸?如何優化?
穆澤林:我們不需要窮舉所有動作,而是學習動作的排列規律。優化主要有兩個方向:一是數據層面,80%用互聯網視頻(已做物理先驗過濾,確保符合現實規律),降低對高成本動捕/真機數據的依賴;二是模型壓縮層面,我們在端側部署上有深厚積累,曾獲得全球頂會最佳論文——通過Token剪枝、量化、動態優化等技術,能把端側計算量降低62倍,推理延時從200毫秒壓縮到10毫秒,模型參數量減少80%的同時精度不降反升(部分任務提升3%-6%)。
硬氪:現在具身智能領域技術路線分化,有的側重記憶,你們是側重動作,您怎么看這種分化?
穆澤林:回歸第一性原理:大語言模型的成功本質是Transformer架構實現了Token的排列生成。具身智能也應該遵循這個邏輯,核心是解決「執行層」問題——讓機器人能穩定完成任務。
像記憶優化這類更底層的問題,我認為短期很難通過初創公司突破,需要DeepSeek、OpenAI這類巨頭在芯片存儲、存算一體架構上的長期探索。我們更務實:通過動作Token的泛化能力(Zero-Shot)解決新任務執行問題,比如機器人學過拿礦泉水瓶,沒學過拿手機,也能通過動作序列遷移完成80%的準確度,剩余20%通過少量后訓練或強化學習校準即可。
硬氪:為什么選擇適配國產算力,而不是用更成熟的英偉達卡?
穆澤林:長期來看,國產GPU是必然選擇——N卡會越來越貴、供應受限。我們的核心優勢是「懂芯片」:團隊有海思、英特爾、英偉達三大芯片巨頭的背景,是國內唯一具備算子級適配能力的具身大模型團隊。目前已經打通了燧原S60、昇騰310/910等國產芯片的部署,下半年目標是攻克千卡級國產集群訓練,實現純國產化的大模型訓練方案。
這不僅能解決供應鏈安全問題,更能提升資本效率:比如別人訓練一次需要1萬張卡、花費5億,我們通過算子優化,1000張卡、5000萬就能完成,類似DeepSeek的低成本訓練邏輯。
硬氪:具身智能芯片的機會在哪里?你們會自己做嗎?
穆澤林:端側具身芯片確實是大機會,目前國內已有20多家公司在布局(比如輝曦、光與星辰等),但大多瞄準200TOPS算力(類似英偉達Orin)。我們認為未來模型需要處理觸覺、傳感器、3D點云等多模態信號,算力需求會快速提升到1000-2000TOPS——如果芯片公司現在量產200TOPS的產品,等流片出來時可能已經跟不上模型迭代速度。
我們不會自己做芯片,除非未來公司規模達到數千億級。現階段更聚焦「軟硬協同」:通過算子優化讓模型適配現有芯片,和芯片公司合作而非重復造輪子。
硬氪:未來產業分工會是怎樣的?大腦和本體是否會各自形成通用供應商?
穆澤林:本體可能會像汽車行業一樣,有不同的特色(比如負載更大、更輕量化),但大腦領域大概率會形成「一超多強」格局——通用大腦的研發門檻極高,國內真正具備研發能力的團隊屈指可數。我們目標是成為那個「超級通用大腦」,同時允許其他團隊聚焦細分場景(比如快遞分揀、電力巡檢)。
5-10年內,不會出現每家機器人公司都自研大腦的情況——大腦的研發投入(人才、算力)遠超本體,創業公司更有機會突破,就像OpenAI不是大廠孵化的。大廠的優勢在純軟件場景,而具身智能需要軟硬件深度結合,創業公司的靈活性和專注度更有優勢。
首頁圖源|企業供圖
排版|范馨雅
end
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.