![]()
拿起漏斗,插入圓底燒瓶;拿起量筒,把液體倒入燒瓶;移走漏斗,將燒瓶放到攪拌器上,再塞入瓶塞并按下開關。
對人來說,這是一串可以按順序完成的動作;但對機器人,每一步都藏著兩個判斷:規劃出的動作能否執行,當前動作是否完成。前者決定規劃會不會脫離機械臂的能力,后者決定模型會不會卡在重復動作里,或還沒完成當前動作就進入下一步。
端到端 Vision-Language-Action(VLA)模型通常根據當前觀測直接生成動作序列。對于短程任務而言,模型僅根據當前畫面生成動作序列通常已經夠用;但隨著任務步驟增多,模型很難持續追蹤哪些操作已經完成,也容易混淆畫面相似的不同階段,導致誤判任務進度。
另一類分層架構的方法:高層 VLM 負責規劃,低層 VLA 負責執行。但二者并不天然兼容 —— 高層給出的往往是較為寬泛的開放語言,低層真正需要的卻是明確到操作對象、目標位置和動作約束的可執行指令。
![]()
![]()
VLA根據單幀輸入難以判斷任務進度而陷入循環。
近日,來自清華大學、上海人工智能實驗室等機構的研究團隊提出了 Cortex,一個面向長程機器人操作的雙系統具身智能體框架。
它的核心思路,是用統一的結構化子任務描述連接高層規劃與低層執行:高層生成的每項任務都明確操作對象、目標位置和動作約束,并被限定在低層執行器已經掌握的技能范圍內;低層執行器在訓練時,也使用相同格式的子任務描述,即「雙向對齊」。
![]()
![]()
- 論文標題:Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation
- 項目網站:https://steinate.github.io/cortex.github.io
- 論文鏈接:https://arxiv.org/abs/2607.05377
- 代碼鏈接:https://github.com/InternRobotics/Cortex
為了讓這種對齊真正作用于長程任務,Cortex 并未只設計一個通信接口,而是從架構、數據、訓練和部署四個方面搭建了一套完整體系。
![]()
視頻鏈接:https://mp.weixin.qq.com/s/_Dkk116WPqO-F8GdCaOvDQ
架構:雙系統分工,精準解決
「能不能做」和「做沒做完」兩大核心問題
在架構上,Cortex 將長程操作分為 System-2 和 System-1 兩個層次,通過結構化的子任務將兩個系統協同對齊,并通過文本記憶持續跟蹤任務進度。
其中上層的 System-2 負責理解任務目標、拆分任務、維護記憶并判斷當前進度;System-1 則接收當前子任務,根據子任務描述里的物體與本體約束,并將其轉化為連續的機器人動作。
System-2 不會一次性生成完整的動作流程,而是根據當前視覺觀測和已有記憶,持續判斷應該保持當前任務、重新嘗試,還是進入下一步。System-1 執行動作后產生的新觀測會再次交給 System-2,用于更新記憶并判斷任務是否完成。
由此,文章開頭提到的兩個問題被分別落實到系統設計中:結構化子任務接口保證高層提出的任務處于低層執行器的能力范圍內,視覺觀測與記憶的循環更新則幫助系統判斷當前任務是否已經完成。
![]()
雙向對齊的具身Agent架構,System-2接受觀測和歷史記憶輸出當前子任務并更新實時記憶
數據:統一技能范式,
讓規劃指令可落地、無歧義
為消除高低層語義斷層,Cortex 將操作行為歸納為 Pick、Place、Pour、Unscrew、Stir 等 32 種標準化技能原語,并為每類技能規定語言模板。
開放式的「把水倒進燒杯」會被整理成技能、目標對象與必要屬性都明確的命令。數據構建時,對于子任務輸出,系統還寫入顏色、空間位置、數量以及可達性等信息,減少「拿那個杯子」或「直接抓取不可達物體」一類語義正確、執行起來無法落地的規劃。
對于記憶的更新,系統進行了語言壓縮、關鍵信息如物體屬性及統計數量寫入等增強操作,提高 Cortex 完成空間理解、物體計數和失敗恢復等復雜任務的成功率。
圍繞這套接口,團隊對 4000+ 小時開源長時序視頻與軌跡進行結構化標注,并修改仿真數據引擎自動生成約 30 小時帶子任務標注的仿真數據。已有數據通過視覺語言模型重寫為統一的子任務模板;自采軌跡則采用一套結合視覺、機器人狀態和動作特征,基于動態規劃的子任務邊界切分工具鏈,實現自動化精準標注。
![]()
訓練:最關鍵的訓練樣本,
集中在動作交界處
長軌跡的大多數畫面都落在動作進行中。若均勻抽幀,模型最常學到的是「繼續做當前動作」,真正決定是否切換子任務的邊界幀反而很少。
Cortex 采用事件均衡采樣(Event-balanced Sampling) 策略:在子任務邊界前后約 1 秒的窗口內加密采樣,同時保留執行階段樣本。模型既要學會動作尚未完成時保持指令和記憶,也要在看到完成證據后更新記憶、切換下一步。
在 Galaxea 數據的消融實驗中,采用事件均衡采樣的模型僅需 272 萬訓練樣本,少于對照組的 310 萬樣本,綜合評分卻從 7.58 提升至 8.18。這說明對高層規劃器而言,增加關鍵轉場附近的監督,比繼續堆疊大量穩定執行畫面更有效。
![]()
Event-balanced sampling 示意圖。橙色區間覆蓋子任務切換;訓練需要同時學會「耐心保持」和「及時換擋」。
實驗:仿真領先幾個百分點,
實機差距出現在完整任務上
Cortex 通過優化 Agent 框架 harness,直接面向真實機器人長程操作驗證。團隊不僅在 LIBERO-Long、RoboTwin 2.0 等仿真環境中測試,還將系統部署到真實雙臂機器人平臺上,Zero-shot 規劃完成由數十個子任務組成的復雜化學實驗任務。
在 LIBERO-Long 上,Cortex 的完整任務成功率為 95.5%,比單獨使用 π0.5 的基線 92.4% 高 3.1 個百分點;在 RoboTwin 2.0 benchmark 下,整體成功率為 86.8%,比 π0.5 的 82.74% 高約 4.1 個百分點。這反映了整套 Agent 框架 —— 高層規劃與底層執行對齊為長程任務的完成帶來的增益。
![]()
更能體現系統差異的是實機長化學實驗任務。研究者在 ARX ACONE 雙臂平臺上設計了兩組 14 步流程,每組進行 20 次試驗。Cortex 在化學液體攪拌實驗和燒杯清洗任務上的完整成功率分別為 65% 和 55%;兩種端到端模型(PI0.5 及 MEM)在這組試驗中都因為混淆子任務階段而中途失敗。
![]()
14 步器皿操作流程。高層規劃器需要持續記錄漏斗、量筒、燒瓶和瓶塞的狀態,并在確認每一步完成后再下發下一條局部指令。
相比傳統端到端 VLA 方法,Cortex 的優勢并不只是某一個模塊的提升,而是對長程任務進行了系統化建模。
它用結構化子任務接口約束高層規劃,用視覺反饋和語言記憶追蹤執行進度,再通過閉環更新持續校正后續決策,使機器人能夠在多步驟任務中保持目標、狀態與動作的一致性。
這種設計讓 Cortex 在仿真基準和真實雙臂機器人實驗中都展現出更強的長程操作能力。更重要的是,它給出了一個清晰的方向:面向真實場景的機器人智能,不能只依賴端到端動作生成,還需要能夠圍繞長期目標組織步驟、吸收反饋、更新狀態,并在復雜流程中穩定推進。
對于真正進入實驗室、家庭和工業現場的機器人來說,這種能力或許正是從 “完成一個動作” 走向 “完成一件事” 的關鍵一步。
作者介紹
論文共同第一作者彭嘉淇,余茜倩與馮德霖均來自上海人工智能實驗室。其中彭嘉淇是清華大學與上海人工智能實驗室聯合培養的三年級博士生,導師為沈淵教授和林達華教授。在王泰研究員的指導下開展包括視覺動作語言模型,視覺語言導航,loco-manipulation 等機器人相關領域研究,致力于構造實現空間語義理解與長程移動操作的可落地具身智能體,曾發表多篇論文在 ICLR,ICRA 等會議上,NavDP/LoGoPlanner 一作,InternVLA-N1 核心作者,曾獲得 ICRA oral。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.