編輯|冷貓
記得何同學做過一個超復雜的流水線項目嗎?
![]()
內容來源:老師好我叫何同學
這個視頻發布于 2024 年 1 月,當時要實現自動疊紙盒,把禮物放進紙盒的自動化操作,正是這樣一個機械臂和自動化編程組合成的流水線。
如果有一個能像人一樣靈活的機器手來折疊包裝,長時間批量地工作,何同學團隊耗費心力打造的龐大流水線的功能,就能夠被兩個小體積的靈巧手給完美實現。
并且也不需要考慮各種流水線上的穩定性,靈巧手自己就能夠解決遇到的位置偏移,變形等問題,全面自主。相比復雜的機械臂和自動化,靈巧手的自由度和泛用性顯然是其不可比擬的。
這很難,但和人類雙手接近的靈巧手,已經出現了。
![]()
這一對雙臂靈巧手,在精細操作、長程任務和泛化性上均展現出了亮眼的成績,而它來自于靈初智能。
在這兩個靈巧手準確協同,實現精巧操作的背后,是一套靈初智能與北大 - 靈初聯合實驗室共同發布并開源的技術范式,稱為 EgoSteer,是一套雙靈巧手通用操作大模型和全棧系統。
![]()
- 論文鏈接:https://egosteer.github.io/EgoSteer.pdf
- 項目主頁:https://egosteer.github.io/#/
到目前為止,業界能跟隨自由語言指令、還能在全新場景里泛化的模型少之又少。
π0.7、DreamZero 這些近期在通用性上取得突破的工作,把機器人能干的活兒從「一個任務」推到了「一批任務」,但它們大多依賴昂貴的真機數據。但我們知道,具身靈巧手最好的數據,必然來自人類的雙手。
![]()
https://mp.weixin.qq.com/s/EFmICtdSJAMXNmz0fxwJUw
EgoSteer 是一個里程碑式的進步。它能跟隨開放式的自然語言指令,完成一百多種語義各異的靈巧操作任務,還能用少量示范快速學會復雜的長程任務。該全棧系統已完整開源代碼、模型權重,數據也將近期開源,為雙靈巧手通用操作開究提供了一套高質量、可復現、可迭代的全棧基線
數據,模型和系統,深度技術拆解
下面我們從三個層面把它拆開:數據、模型和系統閉環。這三塊拼在一起,才能真正被稱為「全棧」系統。
近萬小時人手視頻,變成訓練數據
先說一個反直覺的事實:制約靈巧手大模型的瓶頸,往往落在數據上。但數據本身其實并不稀缺,稀缺的是能拿來訓練的數據。
第一人稱人類視頻,也就是戴著相機以人的視角拍下的操作畫面,是天然的富礦。全網這類可用素材大約有 11.6 萬小時,人手在里面擰、捏、遞、疊,蘊含著海量的交互知識。問題在于,這些視頻原始狀態下噪聲大得驚人:鏡頭劇烈晃動、雙手頻繁被遮擋、既沒有可靠的語言標注,也沒有精確的動作標注。直接拿去訓練,模型學到的是一堆彼此矛盾的監督信號,下游策略只會被帶偏。
靈初把處理這些視頻的管線單獨做成了一個系統,叫EgoSmith。它是一條四階段的全自動流水線,目標是把視頻變成帶精細語言和動作標注的可訓練數據。
![]()
EgoSmith 概覽:EgoSmith 能夠將噪聲較大的第一視角視頻整理為高質量的靈巧操作 VLA 數據,為語言驅動的機器人預訓練提供可規模化的人手交互先驗。
第一階段是預過濾。用簡單但有效的啟發式規則先做一遍粗篩:在 128 個采樣點的網格上算平均光流,光流大的往往對應人在走動、并沒有在操作,直接丟掉;再用 YOLO 檢測畫面里手的數量、尺度和位置,靠幾何規則剔除嚴重遮擋或有旁人亂入的幀,只留下手部操作清晰可見的片段。
第二階段是 4D 運動估計,把頭和手的運動還原到真實物理空間里。EgoSmith 用更輕更穩的 DPVO 做相機跟蹤和關鍵幀深度,用 Any4D 做逐幀的度量尺度深度預測,兩者對齊尺度比之后,恢復出更準確的相機軌跡,再把相機坐標系下的手部運動轉換到統一的世界坐標系。
第三階段是多層級語言標注,這是「聽懂人話」的基礎。先用 Qwen3.5-VL-Plus 把那些沒有實質手物交互的片段再濾掉一批,剩下的每一段都生成從粗到細的五級語言指令:L1 是動詞加賓語這樣的原子指令,L2 是要點摘要,L3 以物體為中心,L4 以手為中心區分左右手分工,L5 則細到分步動作。
第四階段是后過濾,做多級質量控制。episode 級看相機平移分布剔除離群、用硬閾值丟掉頭部運動過大的片段;chunk 級把手腕姿態轉到中間幀、把手指關鍵點投影到逐幀手腕系,剔除坐標空間的離群值;frame 級算相機、手腕、手指的幀間差分,用硬閾值濾掉突變跳變。一層層篩下來,那些因為三維重建漂移、尺度不準、跳幀而變得不可靠的片段被系統性地清除。
最終產出是一個標準化的數據集:橫跨 12 個開源數據集,9.6K 小時、209 萬個片段、10.4 億幀,覆蓋 8969 個不同的物體名詞和 623 個動作動詞。
讓 VLA 學會「想象」:只在訓練時出現的世界模型
有了干凈的數據,接下來就是最重要的訓練模型環節。
EgoSteer的模型本體是一個基于流匹配(flow matching)的 VLA,但它最有意思的設計,是給這個 VLA 掛了一個世界模型專家,而這個專家只在訓練時存在,推理時直接丟掉,不帶來任何額外的計算負擔。
![]()
EgoSteer 概覽:一種結合世界模型增強的 VLA 模型,用于實現可控的靈巧操作。
要理解這個設計的巧思,得先看清模型的骨架。EgoSteer 由三部分組成,共享一個視覺語言主干:
第一部分是主干,用的是預訓練視覺語言模型 Qwen3-VL(2B 規模),采用因果注意力,負責把圖像、語言、狀態這些多模態輸入編碼成表示。
第二部分是動作專家,一個基于 DiT 的模塊,約 3 億參數,通過流匹配來生成動作塊(action chunk)。它采用聯合注意力,既看自己,也看主干的表示。
第三部分是世界模型專家,一個輕量的 4 層 Transformer,約 7000 萬參數。它干的事聽起來有點抽象:給定當前要執行的動作和相應的相機運動,去預測未來那一幀畫面的 DINOv3 特征。
為什么要預測未來?團隊的洞察是,VLA 天生擅長視覺和語言的理解,卻缺乏對「下一秒會發生什么」的想象,而這種想象的缺失,恰恰限制了動作生成的精度。
世界模型專家正是在這一環節進行補強。訓練時,它拿真實動作、相對相機運動和一串可學習的查詢 token 作為輸入,去回歸未來幀經 DINOv3 編碼后的語義特征。
這里有兩個值得說的細節。一是它選擇回歸 DINOv3 特征,而放棄直接預測像素,因為語義特征天然過濾掉了光照變化和背景噪聲,比在像素空間里預測圖像提供的梯度更穩定、更直接。二是這個專家只有 4 層,且以固定間隔去注意主干的層。
它存在的價值,是讓「預測未來」這個目標產生的梯度回流到主干,主干對世界的理解變強了,動作專家的精度自然跟著水漲船高。到了推理階段,這個專家功成身退,一點推理開銷都不留。
EgoSteer 用一套統一的動作空間:手腕位姿用 3D 位置加 6D 旋轉表示,手部姿態用五根手指指尖在手腕坐標系下的位置表示,雙臂雙手加起來是 48 維。人手數據和機器人數據被強行拉到同一種表示格式下。人類操作的寶貴數據,就是通過這套統一表示,平滑地流向機器人。
最后一個工程細節關乎「流暢」。機器人真機推理時,如果每生成一個動作塊就停頓一下等下一次推理,動作會一頓一頓的。為此, EgoSteer 采用了訓練時的 Real-Time Chunking(RTC)技術:訓練時喂給模型一段干凈的、帶隨機延遲的動作前綴作為已知條件,只讓它去噪后續動作,以覆蓋推理延遲。
人在閉環:「無縫接管」失敗機器人
數據和模型之外,全棧系統的第三塊是機器人系統 Robot-Stack。它把遙操作數據采集、模型推理部署、人在閉環糾偏這三件事,融進了同一套底層控制里。
![]()
這套設計的第一層價值是一致性。無論機器人是在自主跑模型,還是人戴著數據手套在手動遙操作,底層共用完全相同的控制環路和 FK/IK 計算邏輯,跑在同一批 ROS2 節點上。
真正精彩的是「人在閉環糾偏」的接管機制。想象一個場景:機器人在執行任務,眼看要失敗了,一位專家需要立刻接管。這個接管的瞬間是個大坑,如果直接把人手的絕對姿態映射到機器人上,機器人的狀態會在交接的一剎那突變,物理上就是一個劇烈的抖動,輕則任務失敗,重則損壞器件。
靈初的解法非常巧妙,稱之為「相對動作映射」。操作員踩下腳踏板發出接管信號的那一刻,系統記錄下機器人當前的末端姿態和人手當前的姿態作為各自的基準。
此后,系統只把操作員手部的相對運動量疊加到機器人的當前狀態上。直觀地說,操作員只要順著機器人當下的姿勢去比劃,就能平滑地接過控制權,全程沒有突變抖動。糾正完成后再踩一次腳踏板,控制權無縫交還給模型。接管成功率超過 85%。
這套機制的妙處在于,它讓在線糾偏的數據收集變得極其低門檻。專家可以在機器人失敗的任意狀態下絲滑接管、示范正確做法,而且只有這些「介入片段」會被留下來作為糾偏訓練數據。
靈初用三輪 DAgger 迭代,在 56 個任務上一共只采集了 3.7K 條軌跡、8.3 小時的糾正數據。靠這套控制棧,團隊以極低的人力成本,采集了覆蓋 193 個桌面操作任務、187 小時的高質量真機數據,涵蓋從簡單抓放到非抓握、重定向、雙手協作、接觸密集等 7 大類操作。
把數據、模型、系統三塊串起來,EgoSteer 的訓練遵循三個階段。第一階段用 9.6K 小時的人類第一人稱數據做預訓練,只用頭部相機,在 128 張 A800 上訓了 175K 步、約 164 小時。第二階段用 187 小時多樣化的真機數據做后訓練,加上胸部相機形成雙視角,學習率降到原來的十分之一。第三階段是多輪人在閉環 DAgger 糾偏。
實驗結果
EgoSteer 的評測拆成了幾個彼此獨立的維度,每一個都在回答一個具體的疑問:它到底能不能聽懂話、能不能應付沒見過的場景、那些精巧的模塊是不是真的有用、近萬小時人手數據最終換來了什么。
可操控性與泛化
EgoSteer 全程只用一個共享模型,不為任何單一任務做專門微調,所有動作都由開放式的自由語言指令直接驅動。評測覆蓋 7 大類操作,從簡單抓放(PnP)到非抓握推撥、物體重定向、雙手協作、接觸密集型任務,一共 40 個日常復雜任務,每個任務在隨機雜亂的場景里試驗 10 次。
最終的整體平均成功率是 75%。
![]()
EgoSteer 在涵蓋 7 個類別的 40 項任務中的可控操作性能。它能夠穩健地遵循自由形式的語言指令完成任務,實現總體 75% 的成功率,展現出良好的泛化能力。
EgoSteer 把評測任務切成了三檔難度。
第一檔是訓練時見過的任務,模型表現穩定。第二檔是組合泛化,指令把已知技能重新拼裝,這類需要理解指令結構、重新編排子技能的任務,成功率65%。第三檔最難,是語義上完全沒見過的新任務,成功率62%。
一個模型在沒見過的語義任務上還能保住六成的成功率,說明它學到的是一套可以遷移的操作先驗,并沒有停留在對特定指令的死記硬背。
數據規模
這個實驗證明了,人手數據的規模在具身智能模型中依舊非常寶貴。
![]()
這是一條清晰的 scaling 曲線。團隊用從零訓練、3K、6K、9.6K 小時四個預訓練規模跑了對照,隨著數據量上去,預訓練損失收斂得更低,真機成功率也穩步爬升,到 9.6K 小時時達到60%,而完全從零訓練的模型只有約30%。三十個百分點的差距,幾乎全部來自預訓練數據。
![]()
橫向和同期工作比,在一組 10 個相對容易的任務上,EgoSteer 平均成功率 74%,同期的 Being-H0.5 是 39%,π0.5 是 22%。論文的分析是,這兩個對比模型都吃虧在預訓練和后訓練階段的動作表示不一致、輸入分辨率更小、缺少部署優化,所以只能應付最基本的抓放,指令跟隨弱、泛化有限、執行也不夠精準。
預訓練價值的終極檢驗
最后一問,也是最能體現預訓練價值的一問:一個在人手視頻上預訓練好的模型,能不能只用少量示范,就快速學會一個全新的、跨本體的、復雜的長程任務。
兩個實驗給了答案。在 RealMan 機器人上,僅用 120 條示范,EgoSteer 就在一個 18 步、耗時 40 秒的折紙盒任務上做到了75% 成功率。在換了一套本體的 AgiBot G1 機器人上,僅用 200 條示范,在一個 9 步、耗時 1 分鐘的拆蛋糕盒任務上做到了83%。
![]()
對照組的結果近乎殘酷。同樣的數據量下,傳統模仿學習方法 Diffusion Policy 和 IMLE、以及沒有做過預訓練的同架構模型,在這兩個長程任務上的成功率全部是 0%。真正讓「少樣本學會一個長程任務」成為可能的,是近萬小時人手視頻攢下的操作先驗,而不單單是模型架構本身。
更多技術信息,請參閱原論文。
用雙手創造未來
具身智能已經是一片火熱的研究領域,行業內仍有一座座難以攀登的技術高峰。怎么把噪聲漫天的人手視頻洗成能訓練的數據,怎么讓模型在動手之前先預演下一幀,怎么讓一個人類專家絲滑地接管一臺機器人,這些問題是各類具身智能研究者,嘗試通過不同的路徑去解決的瓶頸。
靈初智能顯然在技術領域默默耕耘,埋頭在數據管線、預訓練范式和真機閉環這些看不見的地方較勁,用 EgoSteer 把數據、模型、系統三頭一起補齊。
![]()
靈初智能成立于 2024 年 9 月,總部在上海,首席科學家楊耀東是北大助理教授,領銜北大 - 靈初聯合實驗室。創始團隊年齡跨度從 70 后一路排到 00 后,既有在黑莓、Sonos、達闥、京東摸爬滾打近二十年的產業老兵王啟斌,也有天才少年陳源培。
就在今年,這家成立才一年半的公司宣布完成 20 億元人民幣的天使輪加 Pre-A 輪融資,國開金融、上海徐匯資本等一眾國資和產業資本進場。它此前推出的 Psi R 系列,是業內首個端到端強化學習具身模型,也是最早做出能完成長程任務的具身模型的團隊之一。從那時起,它的技術路線就和行業主流的「夾爪加仿真」拉開了距離,一門心思押在「強化學習加人手數據加靈巧手」這條更難走的路上。
真正能往前推進具身智能行業進化的,未必是最高最炫的機器人,而是那些愿意花力氣去清洗數據、去打磨閉環、去把一條完整鏈路跑通并開源出來的團隊。
靈巧的手,終究要接住瑣碎而真實的人間事務。具身智能的雙手,也能創造未來。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.