![]()
作者丨楊婧雪
編輯丨劉恒濤
圖源丨深度機智
物理AI作為下一代人工智能的核心方向,已經成了全球科技競爭的卡脖子必爭之地。
但喊了三年的具身智能,落地難的痛點始終沒解決:通用基座模型缺位,定制化場景成本高,泛化能力弱……行業一邊扎堆卷硬件Demo,一邊在找真正能規模化落地的路徑。
最近,一家擁有國家隊背景的公司,給出了不一樣的答案。
6月26日,由北京中關村學院與中關村人工智能研究院聯合孵化的全棧物理AI標桿企業「深度機智」宣布完成數億元新一輪融資,由國壽長三角科創基金領投,普華資本、誠通科創基金等老股東持續加注,藍湖資本、博彥科技、磐谷創投、朝暉資本、財鑫資本、道禾長期投資、易高資本、明德資本等市場化與產業資本共同參與。
本次融資,距離公布上一輪僅一個月。資本持續押注,看中的不是又一家做機器人硬件的公司,而是它走了一條完全原創的路——在業內率先定義的“人類學習”原創技術路線,以及成立僅一年就跑通數據、模型、本體、場景全鏈路的全棧能力。
過去一年中,同樣高度關注人類第一視角數據的,還有不少國際巨頭和海外具身智能公司。比如特斯拉、具身智能獨角獸公司Generalist AI,以及英偉達,但深度機智的核心技術布局,卻比美國同類項目早了近一年。
2026年6月,深度機智先后登陸央視《朝聞天下》與《新聞聯播》,成為產學研協同創新的標桿范本。在物理AI從“拼Demo”轉向“拼落地”的分水嶺,路線+全棧的雙重先發優勢,正在變成這家公司最深的護城河。
![]()
![]()
提前押注人類學習路線
完成機器人零樣本驗證
深度機智創始人陳凱是科學家出身,畢業于中科大少年班學院自動化專業,是中科大與微軟亞洲研究院聯合培養博士,曾任微軟亞洲研究院首席研究員、北京智源人工智能研究院研究員。現任北京中關村學院導師、中關村人工智能研究院研究員。
![]()
央視新聞陳凱
過去十多年,陳凱一直在深耕人工智能領域,經歷過深度學習技術萌芽期。ChatGPT發布后,他開始思考:如果數字世界已經出現了通用大模型,物理世界是否也會出現類似路徑?
但物理世界的AI,與數字世界的AI最大不同是數據。
通用大模型的訓練數據是現成的,背后是已經運行幾十年的互聯網和人類幾千年積累下來的文字知識。但用于機器人學習的東西,過去沒有被系統記錄過。“具身智能領域,整個數據基礎都還沒有建立起來。”陳凱說。
陳凱注意到人類第一視角數據,是2024年底Meta Aria智能眼鏡發布視頻的時候。
其中宣傳片中閃過一個兩秒鏡頭——機器人戴上了智能眼鏡,這徹底啟發了陳凱。智能眼鏡本身帶有攝像頭,能以人類第一視角記錄人和世界交互的視頻數據。“用這種數據去訓練機器人,可能是具身智能一個非常大的突破口。”陳凱表示。
為什么一定要人類第一視角數據?
陳凱認為,人類第一視角數據本身包含了空間結構和客觀物理規律的信息。首先要讓機器人知道人看到的世界是什么樣的,主要是了解物體位置、距離、大小等空間關系。其次,機器人通過這些數據還能理解世界的變化,掌握物理規律知識。最后,這些數據還能讓機器人理解人如何和世界交互,包括人的意圖、動作和動作形態。
彼時,用人類第一視角數據訓練具身模型,并非主流路線。
更主流的模型訓練路線是VLA端到端訓練和世界模型+Sim2Real仿真協同訓練,用的分別是真機數據和仿真數據。但兩者都有痛點:仿真數據部署到真機極易失效、泛化能力差,甚至需要真機數據微調;而真機數據采集成本高,在機器人商業化初期難以形成數據飛輪效應。
基于此,陳凱和大學室友、科大少院應用物理專業的張翼博,確定了用人類第一視角數據訓練機器人基座模型的技術路線,并在2025年5月聯合創辦深度機智。
![]()
深度機智作為國內首家提出并系統踐行“人類學習”路線的企業,僅過去一年,就率先在機器人身上驗證人類第一視角數據訓練模型的可行性,并在2026年6月完成零樣本(zero-shot)驗證。
在這次驗證中,機器人在從未進行過本體專項訓練,從未使用任何真機數據或仿真數據的情況下,僅憑一個模型,就完成了一些全新的簡單任務。該模型完全基于人類第一視角數據訓練而來。沒有復雜的重定向,而是純粹的數據驅動。
陳凱表示,這意味著深度機智的技術路線已經完成了全棧閉環。“之前我們都是散點能力,能采集數據、處理數據、訓練模型、做出機器人本體。這次驗證,把我們的全棧能力集中體現在一個機器人身上。”陳凱說。
![]()
先理解再執行
打造具身智能全棧系統能力
陳凱表示,用人類數據訓練機器人,要讓機器人“先理解、再行動”。而讓機器人像人一樣理解世界,核心是要做一個具有通用能力的基座模型。這也是深度機智在過去一年研發工作的核心。“但我們必須圍繞著模型開發,把數據采集、數據處理、本體設計全鏈條跑通。”陳凱說。
首先要解決的是源頭的數據問題。2025年,陳凱根本找不到適合的數據供應商,他和團隊不得不從零開始,做了一款分體式頭戴數采設備。
但更難在于,如何才能把這些采集來的人類第一視角視頻數據轉譯成機器可學習的數據?比如人伸手拿杯子,不會考慮杯子和人體的距離、杯柄朝向、多大力氣拿起杯子。但機器學習需要這些數據,才能完成任務。
為此,深度機智搭建了面向物理AI的數據處理體系。與傳統機器人數據更多關注末端軌跡不同,深度機智更關注從人類第一視角數據中提取可被模型學習的物理常識。在陳凱看來,人類第一視角數據的價值并不只是記錄“手怎么動”,而是幫助模型理解“為什么這樣動”“動作如何改變世界”“人在任務中如何判斷和調整”。因此,深度機智的數據體系不是簡單做動作擬合,而是將真實世界中的人類行為轉化為可被具身智能模型學習的時空經驗。
![]()
其次要解決的,是機器人本體與模型之間的協同關系。深度機智并不是為了做硬件而做機器人,而是從“RobotforAI”的理念出發,為AI模型設計更合適的身體。在陳凱看來,具身智能不能把模型和本體割裂開來。只有理解數據怎么來、模型怎么訓練,才知道機器人應該如何設計;也只有理解機器人如何運動,才知道模型需要學習什么。既然深度機智選擇從人類數據出發,那么更適合承載這條路線的本體,就應當盡可能接近人的結構、比例、自由度和活動范圍,從而降低人類動作經驗向機器人系統遷移的難度。
陳凱和團隊找了2個月,都沒在市面上找到符合要求的本體。
恰在這時,陳凱遇到了老朋友何旭國。何旭國深耕機器人本體領域十余年,也是“機器人奧運會”青少年國家隊的總教練。聽了陳凱提出“用人類數據構建具身智能基座模型”的設想后,何旭國被這件事的長期價值打動,決定用自己在機器人本體上的積累,和陳凱、張翼博一起推進具身AGI方向。
有了何旭國的加入,深度機智在擬人體本體設計上快速推進。團隊圍繞“為AI設計機器人”的理念,從結構比例、自由度、活動范圍、控制精度等方面進行重新設計,最終推出全尺寸擬人體機器人Prime,使其成為承載人類數據到機器人執行遷移的重要系統載體。
![]()
何旭國
讓團隊興奮的是,在早期僅使用約千小時規模的人類第一視角數據進行驗證時,模型已經開始表現出對物理世界更強的理解能力。隨著數據規模擴大,深度機智觀察到一個明顯趨勢:模型對真實機器人數據的依賴在下降,同時在一些沒有被顯式規則寫入、也沒有在真機數據中直接出現過的場景里,機器人開始表現出更靈活的泛化行為。
讓陳凱和團隊振奮的案例,是機器人推送胡蘿卜的任務。當時,團隊讓機器人學習的是抓、拿、放這三個動作。但在一次任務里,機械臂夾起胡蘿卜掉落后,機器人并沒有重新選擇抓取,而是把胡蘿卜往盤子里推。一個角度推不進去,換了個角度,用加速方式推。最后發現還是推不進去,才把胡蘿卜抓起來放進盤子。
“當時機器還不會推這個動作,只有人類才會出現這一行為,機器人是通過我們模型學習,自然而然遷移學會了推。”陳凱說,“這是直接實現泛化,通過基座模型的能力,讓機器人涌現出了之前不會的行為。”這說明,人類數據中蘊含的操作策略和物理常識,可能通過基座模型遷移到機器人執行中,并在具體任務中表現出一定的泛化能力。
以上都屬于幫助機器人“理解”要做的事情范疇。
在完成對物理世界理解能力的早期驗證后,深度機智開始進一步推進模型能力向真實機器人執行遷移。此前,團隊已經在常見機器人平臺上驗證過:當模型對物理世界的理解能力提升后,完成具體任務所需的機器人真機數據會減少;在同等數據量下,任務效果也會更好。
真正讓團隊確認路線閉環的,是近期完成的zero-shot驗證。團隊基于物理常識增強的基座模型,從人類完成任務的數據中提取動作信息,并用這些數據訓練機器人動作策略。整個過程中,模型沒有使用深度機智這款擬人體機器人的真機數據,卻能夠驅動其完成相關基礎任務。
陳凱也強調,當前驗證仍處在早期階段,機器人能夠完成的是一些基礎任務,成功率和任務復雜度還需要繼續提升。但在他看來,單單這個現象已經證明:通過人類數據、通過人類學習范式去構建具身智能模型,這條路徑是可行的。
接下來,深度機智要解決的是工程化、規模化和成功率提升問題,讓機器人能夠處理更多、更復雜的任務。“我們要做的事情,就是堅定地朝著通用性進發。”陳凱說。
![]()
沿途下蛋:
全棧能力進入真實客戶場景
深度機智的全棧路線,也讓公司在商業化上實現了“無心插柳柳成蔭”的效果:公司并不急于把基座模型能力包裝成單點場景交付,而是圍繞物理AI基座模型長期演進。但圍繞這一目標沉淀出數據采集、本體系統、遙操作和開發平臺等全棧能力,已經可以進入真實需求場景,并在客戶側形成驗證。
目前,深度機智的數采設備、教育機器人、人形機器人及其遙操作系統等產品方向均已進入真實客戶場景,并在各個方向的產品線形成了商業落地,累計完成了數千萬元級訂單,顯示出市場對物理AI全棧能力的真實需求。
這些業務并不是偏離主線的短期變現,而是深度機智在構建物理AI基座模型過程中自然沉淀出的能力。教育機器人Prime Lite面向中學、高校和開發者場景,幫助學生從結構設計、硬件裝配、數據采集到模型訓練和部署,完整理解具身智能系統如何工作;數采設備及解決方案進入實驗室、護理、工業等真實任務環境,用于工作流程記錄、操作規范輔助和物理技能沉淀;高精度、低延遲遙操作系統則面向高危、異地和精細操作場景,為機器人進入真實任務環境提供早期解決方案。
![]()
陳凱將這種商業化節奏稱為“沿途下蛋”:一方面,公司不會為了短期交付而讓核心模型團隊偏離基座模型長期目標;另一方面,圍繞基座模型建設形成的數據、硬件、本體和工程能力,也可以先在真實場景中創造價值,并反向積累數據、需求和場景反饋。
在陳凱看來,物理AI真正大規模落地的前提,是基座模型能力達到足夠高的閾值,能夠顯著降低機器人進入不同場景的時間成本和適配成本。“我們希望通過基座模型的開發,將來能夠實現一個人一天就解決一個場景。只有達到這樣的一個狀態,我們才能和各種各樣的場景方,和機器人伙伴合作,借助我們的基座模型能力,讓機器人進入各個場景,具身智能才會迎來大范圍的落地,創造真正的價值。”陳凱說。
本文為創業邦原創,未經授權不得轉載,否則創業邦將保留向其追究法律責任的權利。如需轉載或有任何疑問,請聯系editor@cyzone.cn。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.