![]()
要跨越基模能力、集成開發、連續作業這三座大山,具身大腦怎么實現“三級跳”?
作者丨董子博
編輯丨齊鋮湧
殺入 2026 下半年,燙得發紅的具身賽道,距離第一次交卷正在越來越近。
而要實現具身智能的泛化落地,中國的具身公司,缺的不是硬件、不是場景、甚至不是數據采集能力——行業各家公司的不同硬件、算法、場景各自為戰,數據的碎片化才是真正的問題。
少了把硬件、場景、數據連接在一起的標準,采集到的數據無法跨任務、跨機型的復用,那么數據的收集效率就要事倍功半,從 10 萬小時到 100 萬小時的“鯉魚躍龍門”,也就更是難上加難。
卡住了具身“脖子”的 100 萬小時數據,想要單純靠數采“堆”出來并不現實;而不少公司期待的,讓機器人進入實際場景形成的“數據飛輪”,面前還有三座大山必須跨越:
基礎模型能力的限制,常常讓機器人在實際場景里的具體任務上表現不佳,有效的經驗沒多少,翻車教訓倒是一大堆,數據的質量也就沒法保證;
開發集成的復雜程度,讓具身大腦每每進入到一個新的場景、適配一個新的機型,就必須重新適配,效率難以得到保證;
在同一場景下,全時連續地執行任務也是一個難點,數據回流時斷時續,也讓數據的飛輪更難運轉起來。
要越過三座大山,具身公司必須搭起一個“三級火箭”,用全棧的方式,實現一個系統性的能力升級。
![]()
01
什么樣的具身模型,
才最可能實現“泛化涌現”?
在多個場景能實現能力的泛化,可以 Few-shot,甚至 Zero-shot 地實現智能涌現,是每一個具身模型落地應用的重要指標。
要實現面向開放世界的通用具身模型,就需要更大的數據規模、更先進的架構,以及更強的開放世界泛化能力。
2026 年 7 月 9 日,原力靈機在北京主辦了 Action 2026 開發者大會。會上,公司推出了他們獨立自研的具身基礎模型——“DM0.5”,正式向卡住了具身實際落地的模型問題宣戰。
![]()
這個 4B 參數規模的模型,背后是 5 萬小時包含百余種豐富動作的真機數據,加上了 10 萬小時的場景視頻,讓 DM0.5 在前面提到的三大任務和六類機器人選型上都有數據支持,可以覆蓋日常出現的主要場景和任務。
![]()
之所以說,DM0.5 更有希望讓具身機器人在場景中落地,首先最核心的,就是它強大的泛化能力。
檢驗泛化能力最重要的指標,就要看模型在 Zero-shot 和 Few-shot 的能力。今天,不少公司 Demo 相當好看,卻都是在給定任務上進行過無數次“排練”的“表演——而現實世界沒法被窮舉,面對未進行任何訓練的目標任務,具身模型必須要能夠舉一反三。
在這種環境下,DM0.5 的能力也相當能打,相較先前的 DM0 版本,Zero-shot 的導航成功率提升了 31%,Few-shot 的成功率提升了 45%。模型可以在沒有專門受訓的情況下,完成“看懂目標——做出動作——跨本體將語言與視覺統一成執行結果”的流程閉環。
![]()
![]()
有了更強的“舉一反三”能力,模型要實際進入場景,Fine-Tuning(模型精調)也是相當重要的必修課。
DM0.5 的 Fine-tuning,不僅支持 4090 的消費級顯卡,成本下降了 60%,成功率還反而提升了 20%,最快 18 小時即可完成一個下游任務的部署。推理上,DM0.5 的效率也令人艷羨——在 4090 上的響應速度僅有 90 ms,在 H100 環境下,響應速度更是達到了 50 ms 的優秀成績。
在面向真實工業和真實場景的真機 Benchmark 中,RoboChallenge 是被不少業者承認的榜單。面對 30 個復雜任務、4 種異構機型的挑戰,DM0.5 的成功率達到了 43%,以 54.42 的總得分拔得頭籌。
除了 RoboChallenge,DM0.5 在 LIBERO 的綜合表現達到了 99.10%(Clean 場景: 94.1% / Random 場景: 94.4%),并且在 RoboTwin 2.0、R2R、RxR 三個榜單中以很大優勢領跑。通過更強的上下文工程,DM0.5 也實現了長達 60 秒的原生記憶,來對抗傳統具身模型“走一步忘一步”的尷尬。
在典型的桌面清理場景,DM0.5 驅動的機器人能夠記得物品的來處,以便可以精準地將其放回原位。除此以外,在人類的示范之后,DM0.5 也可以讓具身機器人立刻和示范行動對其,并且跟隨完成復雜任務,讓使用者可以不必多費口舌,把人機交互又一步完成了簡化。
桌面保潔:記得來處,才能放回原處。最后,DM0.5 也通過結合高階大腦(系統2)和直覺反射(系統1),實現針對相機擾動、人類動作更強的抗干擾性能;而其“多任務+多機型”訓練方式,更能讓 DM0.5 在不同的本體上實現更快的適配,無論雙足、輪式、單臂、雙臂、靈巧手都不在話下,覆蓋導航、抓取、全身控制的三大核心任務。
今天,DM0.5 已經在 GitHub 上開放了官方倉庫,在 HuggingFace 也上線了 DM0.5 模型權重和官方 Blog。而在一周后,原力靈機也將正式向 LeRobot 社區提交核心代碼,并面向全行業公開深度技術報告,用生態開源的方式,把更優秀的具身大腦向市場提供。
如果說,過去的具身范式,是“執行固定指令、單次動作重復”;今天,在 DM0.5 的驅動下,具身智能正在向“理解意圖、多維連續泛化、長時可靠運行”完成躍升。
而強大的模型,只是具身跨越“三座大山”的“第一級火箭”,而全棧的能力,才是補全具身落地的一塊重要的拼圖。
02
為什么只有全棧,
才能讓通用具身更好地落地?
如果說,具身模型可以通過 Scaling Law 實現線性的可見提升;那么全棧能力,則是對具身公司的一場逃不開的“大考”。
具身要落地,只有模型顯然不夠,沒有性能更好的本體、更好用的工具鏈、更好的多機器人協作系統,具身就沒法真正成為用戶可用的生產力,在實際場景中發揮實際用途。
面對這場大考,原力靈機也做足了準備。
給“大腦”一個更強大的“身體”,原力靈機推出了通用具身本體 2.0-Apex。
DM0.5 能夠兼容更多形態的本體,2.0-Apex 則干脆將機器人的諸多部件進行了解耦設計,讓用戶可以根據自己的需要,一分鐘內對底盤、手臂、靈巧手和夾爪等部件進行熱插拔,實現“十八般武藝”的樣樣精通。
算力上,2.0-Apex 的底層算法采用 1k HZ 高頻控制,讓基礎動作安全絲滑;端側搭載了 Thor 的頂級芯片,讓本體高頻的實時推理成為可能;同時,針對復雜決策和邏輯規劃,通過 WiFi 7 的高速天線,2.0-Apex 也可以無縫連接云端大模型,讓具身機器人的更高智能無需等待。
除此之外,由腕部相機和激光雷達組成的 360° 無死角感知、毫米級末端定位的強大夾爪、1000 小時以上的 MTBF(平均無故障工作時間)、30 秒不停機的快速換電等等方面,都是原力靈機本體工程的“基礎操作”,讓本體可以更易量產,在工業、物流等真實復雜場景,承擔更高強度的作業。
![]()
大腦和身體齊備,開發者要把具身機器人用到實處,一套工程化、系統化、平臺化的支持層也必不可少。為此,原力靈機也推出了開發者平臺 DexDev,一次打出 DFOL 2.0、DexOs 和 MaaS 的“三板斧”,給具身落地提供保姆級的保駕護航。
對待具身機器人,今天的產業界總是“既要又要”,高成功率、高節拍、高魯棒性缺一不可。DFOL 2.0,這套世界模型驅動的閉環強化學習框架,也就在原力靈機的手下應運而生。
DFOL 的 1.0 版本,原力靈機已經讓“具身原生應用的量產工作流”成為了現實;而到了 2.0 版本,公司想要的,則是讓世界模型成為更高保真的仿真器,直接把強化學習放進虛擬世界跑通。
為了實現這個效果,公司還同步推出了通用具身世界模型 DW0.5。與剛剛提到的 DM0.5 只有一字之差,DW0.5 的仿真能力更強。在 DFOL 2.0 的運行閉環中,DM0.5 提供的是初始動作塊和基礎策略,DW0.5 則可以在線批量生產 Rollout 1 到 Rollout N 的視覺軌跡預測,來還原未來世界的狀態,負責評估的“教練員” CFG-RL 則根據軌跡,進行通用任務的進度評估,并將打分結果與獎勵信號實時回傳,來更新模型權重,實現具身智能的自我演進。
一句話總結,DM0.5 負責輸出動作,DW0.5 則負責模擬,CFG-RL 負責打分,打分的結果則可以用于模型的下一步優化。
這樣,DFOL2.0 不僅把整體的訓練成本降低了 40%,復雜真機任務(比如打氣球、晾衣服、調酒等)的成功率也得到了顯著提升。不僅如此,這套閉環的強化學習鏈路,還通過極大降低了真機訓練數據的需求,順便解決了硬件的損壞和優化問題,讓強化學習的規模化成為了可能。
和 DM0.5 一樣,DW0.5 和 DFOL 2.0 也同樣加入了原力靈機的開放生態,前者已經正式開源,后者也正面向全球開發者開放使用。
![]()
要實現一腦多形,最理想的方式當然是無論何種機型,都可以實現一鍵接入。原力靈機的具身操作系統 DexOS 則專為打破機型的壁壘被設計了出來,通過 ECP(Embodied Control Platform)的多層級系統協作,開發者只用幾行 Python,就能實現機器人的連接、感知獲取、模型推理與動作執行。
而面對更大的開發者群體,原力靈機發布了行業的首個通用具身 MaaS 服務,不僅支持通用的具身模型,也可以支持滿足特定場景的定制模型。開發者可以登錄一站式的可視化數據及模型管理工作臺,并上傳 LeRobot v3 格式的數據集,進行私有數據的聯合訓練,價格僅在 1 元/百萬 token 左右。
有了本體和開發平臺,原力靈機還不想止步于此。面向多機器人協作的關鍵場景,他們手搓了一套給具身智能設計的“Harness 框架”——Ferrata(飛拉達)。
然而,在真實、復雜的物理場景下,單一功能的機器人本體能力再強,也往往難以勝任所有工作。多個機器人一起協作,就難免“打架”,這也讓機器人的大規模部署成為了具身落地的重要卡點。
在 DM0.5 和 Realtime-VLA 的支持下,Ferrata 設計了一套機器人分層作業的架構,把標準自動化、具身執行和人工接管的任務進行拆分,來明確日常作業的分工,并以此實現自動化的異常管理和物理容錯。
![]()
這套架構,在降低了客戶部署的成本之余,還通過多機器人大規模部署的方式,建立自己的數據飛輪,結構化記錄實際生產的高質量數據,以持續反哺 DM 系列大模型的能力進化。
03
如何穿越具身技術與產業周期
回顧一開始說到的,要翻過具身落地的“三座大山”,原力靈機在 Action 2026 的開發者大會上,都一一給出了解法。
模型能力限制具身落地效果,原力靈機就通過更大的數據、更優的架構做更好的泛化性能,來給具身提供更強的智能動力;
集成開發太復雜,原力靈機就給開發者提供更易用的一站式開發者平臺,來提升機器人在具體場景里的表現;
全時連續作業效率低,原力靈機則用多機器人協作的 Harness 框架,來把模型送進產業場景,讓客戶用得多快好省。
本質上,一個產業從出生到落地,必然會經歷一個先“煉丹”,再“造車”的路徑——當技術路徑逐漸收斂,標準化、規模化就成為了產業必須突破的桎梏。
這條路,通用具身自然不能例外,要讓機器人真正走進工廠、走進家庭,靠的不會只是某項前沿突破的技術,而是出于對物理世界的敬畏之心,把模型、系統、場景的每一步都進行拆解,再把每一個原子都做到最優。
要做到如此地步,一家公司靠的不只是一時的靈感,更有近乎執拗的耐心與堅持。只有這樣,才能穿越具身行業波譎云詭的周期,以先行者和實干者的身份,長久地留在行業中,見證未來的到來。
![]()
![]()
![]()
未經「AI科技評論」授權,嚴禁以任何方式在網頁、論壇、社區進行轉載!
公眾號轉載請先在「AI科技評論」后臺留言取得授權,轉載時需標注來源并插入本公眾號名片。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.