諾亞 發自 凹非寺
量子位 | 公眾號 QbitAI
2009年,李飛飛團隊正式發布ImageNet。
隨后,以ImageNet為基礎形成的大規模視覺識別任務,讓不同機構第一次能夠圍繞共同的數據集、類別體系和評測指標訓練模型、比較結果。
得益于這套可以持續擴展、統一比較的數據與評測基礎設施,圖像識別和深度學習開始快速發展。
17年后,李飛飛的博士生Danfei Xu,開始為機器人學習尋找類似的協作基礎設施。
Danfei Xu目前擔任佐治亞理工學院交互計算學院助理教授,也是機器人學習與推理實驗室(RL2)的負責人。他在斯坦福大學攻讀博士期間,由李飛飛和Silvio Savarese共同指導。過去幾年,他持續研究一個問題:機器人如何從人類演示中學習,并將這些經驗遷移到不同任務、環境和機器人本體上。
![]()
這條研究線,最終匯入了EgoVerse——“第一視角人類操作數據生態”。
EgoVerse是一套持續增長的第一視角人類操作數據生態與標準。EgoVerse最新公開的聯盟伙伴中,除了佐治亞理工、斯坦福、蘇黎世聯邦理工和UC San Diego等學術機構,還包括Meta、Scale AI、光輪智能、Mecka AI、MicroAGI、Trace Labs等公司。
最值得的關注是,光輪智能作為唯一一家中國公司,出現在這個頂級大佬云集的全球標準牌桌上。
EgoVerse:Danfei想做的不只是一個數據集
機器人學習長期面臨一個明顯的數據悖論。
目前機器人訓練仍然依賴真機遙操作,每增加一條演示,都需要機器人硬件、操作人員、實驗場地和復位流程。采集速度慢、成本高,能夠覆蓋的任務和場景也很有限。
而人類的各種行為天然包含豐富的視覺信息、動作過程、物體交互和任務策略,明顯是機器人更好的老師。
第一視角人類數據提供了新的路線:先記錄人如何在真實環境中完成任務,再把這些經驗遷移給不同機器人。
但過去的人類數據集大多是一次性項目。
不同團隊使用各自的采集設備、坐標體系、動作標簽和任務定義,數據發布后也很難持續擴張。即使兩家機構都采集了“把杯子放到碟子上”,兩份數據也未必能夠直接放在一起訓練。
Danfei及其合作者因此沒有把EgoVerse設計成又一份靜態數據集,而是做成了一套“活”的協作框架。
![]()
EgoVerse當前公開版本包含1362小時人類演示數據、約8萬個episode、1965項任務、240個場景和2087名采集者。數據不僅包含第一視角視頻,還提供相機位姿、三維手部信息以及細粒度語言描述,并在不同實驗室、不同任務和不同機器人本體上驗證人類數據的遷移效果。
一套事實標準形成之前,往往要先完成幾件事:
讓參與者采用共同的數據結構,遵守共同的任務語義,生產可以相互兼容的數據,并用統一方法檢驗這些數據是否真的有效。
EgoVerse正在做的,正是這一步:先讓全球具身數據開始按照同一套“語言體系”流動。
EgoVerse的核心共建方,都是什么背景?
具身人類數據并不是戴上一副眼鏡、錄一段視頻,再加幾個標簽那么簡單。完整采集流程至少包括研究問題定義、采集硬件、動作遷移、規模化運營、數據標注和機器人驗證。任何一家機構,都很難單獨完成所有環節。
EgoVerse召集了具身領域里最頭部的高校、學者、機構進行全球協作,共同定義具有劃時代意義的數據標準。
![]()
佐治亞理工Danfei Xu教授:具身人類數據采集路線標志性代表,EgoVerse的發起人
佐治亞理工承擔的是EgoVerse的組織中樞和研究框架角色。Danfei Xu與RL2團隊長期關注機器人如何從人類數據中學習。到了EgoVerse,問題不再只是“某一批人類視頻能不能改善某一臺機器人”,而是進一步升級為:人類數據的效果能否跨實驗室復現?能否跨機器人本體成立?數據規模增加時,能力是否穩定增長?哪些類型的數據才真正具有遷移價值?
EgoVerse讓不同實驗室在共享協議下重復實驗。佐治亞理工學院負責的代表任務是object-in-container,斯坦福大學負責雙臂精細操作,UC San Diego和ETH Zurich則參與長時序雙臂任務驗證。由此,Danfei搭起一種新的協作方式,使過去互不兼容的數據、算法、機器人和實驗室,開始在共享協議下回答同一組問題。
斯坦福Shuran Song教授:UMI發明人,讓人類操作經驗能夠遷移給機器人
人類有柔軟靈活的雙手,機器人可能只有兩指夾爪;人可以依靠觸覺、經驗和身體協調完成任務,機器人卻需要明確的觀測和動作表示。因此,人類數據并不會天然變成機器人能力,中間橫著一道“具身鴻溝”。
Shuran Song帶領的斯坦福REAL Lab,是打通這條路徑的代表團隊之一。其團隊開創的UMI——Universal Manipulation Interface,使用便攜式手持夾爪采集真實環境中的人類操作,再將這些演示轉化為可部署的機器人策略。
UMI的關鍵價值,是讓數據采集擺脫固定機器人和實驗室。人可以帶著設備進入真實環境進行復雜長時序任務,學習得到的策略還能遷移到不同機器人平臺。
簡單說,斯坦福要解決的是:讓人類經驗變成機器人能執行的動作。
Meta:為EgoVerse提供專用數據采集眼鏡
第一視角數據采集首先需要一雙合格的“眼睛”。Meta研發的Project Aria,是行業首個專為“大規模基礎模型”設計的專用數據采集硬件,可以記錄第一視角視頻、手部動作、相機位姿和空間信息。設備包含面向前方的RGB相機,以及用于SLAM和手部追蹤的同步場景相機。沒有這類空間感知能力,第一視角數據很容易只是一段“看起來像人在干活”的視頻。Meta解決的是如何把“人看到了什么”,升級為“人在三維世界中如何行動”。
![]()
Mecka:人類數據先驅,把數據采集從專用眼鏡普及到手機
如果一套人類數據生態只能依賴少數專用硬件,它能夠覆蓋的采集者與真實環境就始終有限。
Mecka AI推動了一條更便攜的采集路線:使用iPhone與輕量化頭戴裝置完成第一視角采集,再通過云端處理恢復頭部軌跡與雙手三維關鍵點。
這一方案讓第一視角數據不再只來自少數機器人實驗室,而能夠進入家庭、商店、工作場所和更多真實任務環境。
Mecka AI所解決的,是如何讓人類數據采集從專用設備走向更低門檻、更廣覆蓋的生產方式。
Scale AI:人類數據的規模化制造工廠
數據采回來之后,還要經歷清洗、標注、質檢、結構化和版本管理。
Scale AI從2016年起長期從事AI數據基礎設施建設,最早以自動駕駛等場景中的大規模數據處理能力聞名。進入Physical AI階段后,它又把數據工廠數據擴展到機器人數據采集、標注、人工反饋和模型驗證。
Scale更擅長把數據生產變成一套成熟的運營和處理系統,從而在人類演示從幾百條變成幾萬小時后,把大規模、異構的原始采集結果,轉化為穩定可用的數據產品。
光輪智能:在規模化的前提下,構建人類數據最高質量標準
當具身數據生產真正邁向千萬級小時,單單依靠采集工具和后處理,無法滿足規模化下的數據質量需求。同時,采集設備越多、采集人員越多、場景越復雜的趨勢下,視角偏移、動作遺漏、任務中斷、設備異常和標注不一致等問題也會被同步放大。
數據可以快速增長,但真正能被機器人學習的有效信息,并不一定同步增長。
而光輪智能補上的,是一套貫穿端側采集、云端處理和仿真驗證的質量控制體系。
與綁定某一款眼鏡或采集設備的方案不同,光輪智能的目標是讓數據管線兼容不同硬件。無論原始數據來自Aria、iPhone、頭戴相機還是其他多模態設備,都可以進入統一的云端管線,通過VIO、三維手部與Body標注、V7級動作語義標注,被轉化成同一質量標準下的訓練資產。
數據完成處理之后,光輪智能還會利用物理仿真SimFoundry和模型評測能力RoboFinals,進一步驗證動作軌跡、物理關系和任務過程能否被合理還原,并判斷數據是否真正具有機器人學習價值。通過不斷的回環評價,掌握最快速的質量反饋,并且不斷迭代,引領標準。
因此,光輪在EgoVerse中的貢獻,是讓數據在規模化生產中依然做到源頭可控、跨硬件統一、價值可驗證。
此外,MicroAGI也在探索分布式眾包采集,通過讓操作人員在真實家庭環境中自然完成任務,將人類數據生產從實驗項目轉化為可持續運營的采集網絡。
規模化之后,光輪智能如何定義高質量人類數據
傳統數據質量控制,通常關注文件是否完整、格式是否正確、軌跡是否缺失,以及標注是否通過。
但這些指標最多只能證明一條數據在生產流程上“合格”,不能證明它真的值得機器人學習。
一段視頻可能拍攝完整,動作軌跡卻無法被機器人執行;一條標注可能符合規范,其中的任務過程卻缺少關鍵步驟;一批數據看起來數量龐大,實際覆蓋的人群、場景與動作分布卻高度重復。
光輪智能將人類數據質量拆成三個連續環節。
首先,用Agent驅動數據采集質量與數據分布。
在光輪智能看來,具身數據最大的質量風險,經常發生在采集現場。
關鍵動作是否進入畫面?手與物體的交互是否被遮擋?任務起點和終點是否完整?采集者是否偏離操作要求?一個episode雖然錄制完成,是否真正包含完整的學習過程?
如果這些問題等到數據上傳后才被發現,往往只能整段作廢,或者重新組織人員補采。
光輪智能的Agent驅動采集體系,會圍繞設備狀態、任務流程、動作完整性和有效視角進行實時檢查,并在發現風險時推動現場糾偏或補采。
更重要的是,Agent不僅負責單條數據質檢,也可以根據已有數據分布,調控下一輪需要采集的人群、場景、任務與動作類型,避免數據規模增長后出現大量重復樣本。
這使數據質量從事后抽檢,轉化為生產過程控制。
其次,通過兼容多種采集硬件的云端平臺,實現統一的數據標準。
無論原始數據來自眼鏡、手機、頭戴相機還是其他多模態設備,都需要經過云端統一的處理和質量控制,才能進入同一個訓練體系。
光輪的處理流程包括視覺慣性里程計,也就是VIO,用于恢復相機在空間中的運動;三維手部與Body標注,用于還原人的身體動作和手物交互;以及V7級動作標注,把一段連續視頻進一步切分為可以與任務過程對齊的動作語義。
光輪智能的人類數據解決方案EgoSuite,能夠在生產規模上提供三維手部、三維全身姿態和幀級語義標注,并強調在遮擋和近距離物體交互情況下維持穩定追蹤。其平臺也公開強調對不同商業設備、研究型眼鏡、動作相機和定制采集系統的兼容能力。
這套思路可以用一句話概括:硬件可以多元,進入模型之前的數據標準必須一致。
最后,用仿真與評測檢驗數據價值。
數據處理完成后,還要回答一個更關鍵的問題:這些數據,是否真的值得機器人學習?
光輪智能將自研仿真平臺SimFoundry與工業級評測平臺RoboFinals接入人類數據質量閉環。SimFoundry將人類數據中的動作軌跡、物體關系和任務流程,轉化為機器人可執行、可復現的仿真任務;RoboFinals則通過標準化評測,驗證這些數據究竟提升了哪些任務,又會在哪些機器人本體、場景和物理條件下失效。
因此,數據價值不再由生產方自行定義,而是由機器人訓練和評測結果共同驗證。評測過程中發現的失敗案例,也會進一步反饋給采集端,指導下一輪需要補充哪些數據、擴大哪些分布、修正哪些采集規則,形成持續優化的數據閉環。
最終,高質量具身人類數據形成一條完整的數據質量閉環:
端側Agent實時控制采集質量 → 多種采集硬件統一接入云端 → VIO、手部、Body Pose與動作語義標準化處理 → SimFoundry將人類數據轉化為機器人可執行任務 → RoboFinals驗證數據學習價值并定位失敗模式 → 評測結果反饋下一輪數據采集。
![]()
唯一中國公司,進入全球兩大具身基礎設施標準
隨著具身智能從單點技術驗證走向規模化發展,行業競爭正在從模型能力,進一步延伸到底層基礎設施與標準體系。
其中,兩條關鍵主線正在形成。
一條是以EgoVerse為代表的數據基礎設施,定義高質量具身人類數據如何采集、組織、處理、共享和持續迭代;另一條是以Newton為代表的物理仿真基礎設施,定義機器人如何在遵循真實物理規律的仿真世界中完成訓練、驗證和評測。
![]()
Newton由NVIDIA、Google DeepMind和Disney Research聯合發起,由NVIDIA、Google DeepMind、Disney Research、光輪智能和Toyota Research Institute(TRI)五家企業共同組成技術指導委員會(TSC),持續定義機器人仿真與物理建模的技術路線,正逐漸成為全球具身智能的重要物理仿真基礎設施。
前者解決機器人從哪里獲得可規模化的學習經驗,后者解決這些經驗如何在物理世界中被復現和驗證。數據與仿真,共同構成物理AI走向規模化的兩大底座。
光輪智能成為目前唯一同時參與這兩套國際標準體系的中國企業。
在EgoVerse中,光輪帶入的是一套貫穿人類數據生產全流程的質量體系:從端側Agent管理采集過程,到多種硬件數據進入統一云端管線,再到通過仿真與模型評測驗證數據價值。人類數據質量由此從依賴人工抽檢和經驗判斷,走向可定義、可比較、可驗證、可持續優化的工程標準。
在Newton中,光輪參與物理求解、仿真資產、機器人訓練與評測等核心能力建設,推動真實世界中的物體、任務和物理過程,轉化為機器人可以交互、訓練和驗證的仿真基礎設施。
這意味著,光輪參與定義的不只是某一種數據格式,也不只是某一套仿真工具,而是連接真實世界數據、物理仿真、模型訓練與能力驗證的底層標準。
如果說ImageNet為視覺AI建立了共同的數據基礎設施,那么EgoVerse與Newton則分別從數據和仿真兩個方向,為物理AI建立新的全球基礎設施。
光輪同時進入EgoVerse與Newton,參與建設的已經不只是今天的工具鏈,而是未來全球具身智能產業共同遵循的底層基礎設施。這也意味著,中國企業開始從標準的使用者,走向全球物理 AI 基礎設施規則的共同定義者。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.