![]()
![]()
具身最終還是要發(fā)揮價值,說白了是GDP邏輯,單位時間能干多少事。
作者|周悅
編輯|王博
“甜蜜的毒藥”。丁文超用這個詞形容具身智能公司拓場景時最容易踩進去的坑。
一個新場景,表面上意味著新客戶、新收入。但真正做進去,硬件要穩(wěn),數(shù)據(jù)要補,模型還要能泛化。場景越多,交付越亂,單點做不透,能力也很難外溢。
這種警惕,來自丁文超在自動駕駛里的教訓。2020年,他入選華為“天才少年計劃”,進入車BU做智駕。
那幾年正是自動駕駛從前沿技術走向規(guī)模化產品的關鍵期,他親眼見過場景一旦鋪開、交付會變得多復雜。“我的經驗是,一切東西都要能夠規(guī)模化。規(guī)模化不了,將來賣給用戶會很折磨。”
帶著這種判斷,線束裝配很早就進入了它石智航(下稱“它石”)的視野。
線束柔軟、易變形,并且屬于長程、復雜任務,對精度、任務規(guī)劃能力和成功率要求都很高。它不像搬運、分揀那樣容易被外界一眼看懂,也不是傳統(tǒng)自動化能輕易覆蓋的標準化任務。模型、數(shù)據(jù)、硬件、部署里任何一環(huán)有短板都藏不住。
今年3月,它石A1機器人完成百余次亞毫米級柔性線束裝配,拿下吉尼斯世界紀錄。一個月后,4.55億美元Pre-A輪融資落地,刷新中國具身智能最大Pre-A輪和最高單輪融資紀錄。
紀錄和融資讓它石被更多人看見。但線束也不再是冷門選擇,越來越多具身企業(yè)開始盯上這個場景。它石的先發(fā)優(yōu)勢,還能維持多久?
線束之外,它石還有更多“反常識”的選擇。行業(yè)集中討論VLA模型路線時,它石提出AI World Engine(AWE);不少公司還在依賴仿真和遙操作采數(shù)據(jù)時,它石押注human-centric(以人為中心)的真實數(shù)據(jù)采集。
丁文超把它們放在同一個三角形里:數(shù)據(jù)、通用AI模型、核心零部件與終端應用。“我們從第一天開始,就設定了這三個角,而且在每個角上根據(jù)第一性原理,都做了比較反常識的選擇。”
丁文超是它石智航聯(lián)合創(chuàng)始人兼首席科學家。離開華為后,他回到復旦大學,擔任研究員和博導,搭建了具身智能實驗室MagicLab。后來,他與其他幾位業(yè)界大牛聯(lián)合創(chuàng)辦它石。
有意思的是,這個具有強工程化背景的人,聊起技術與產品愛用武俠語言。回顧創(chuàng)業(yè)節(jié)奏,他說最深的感受是“天下武功,唯快不破”;聊起技術路線的抉擇,他又借《神雕俠侶》里的玄鐵重劍作喻:“重劍無鋒,大巧不工。”
近期,「甲子光年」專訪丁文超,從線束開始,聊到智駕經驗、世界模型,以及他的創(chuàng)業(yè)之路。
![]()
它石智航聯(lián)合創(chuàng)始人兼首席科學家丁文超,圖片來源:它石智航
1.盲目拓場景是“甜蜜的毒藥”
甲子光年:最近一些具身智能公司也宣布把線束作為重點,你們很早就切入線束場景,怎么看這個場景的壁壘?
丁文超:歡迎他們來做,但這里面確實非常難。
場景沒有秘密。我經常說,場景分散對于基礎模型不強的公司來說是甜蜜的毒藥。看起來有客戶、有收入,但做不透,能力不能外溢。當基礎模型能力不強時就去擴場景,很可能每個場景的解決方案都長得不一樣。
自動駕駛有一個關鍵的轉折點,就是靠端到端實現(xiàn)one model。對所有場景、所有條件,只訓練一個模型,背后是一套訓練、數(shù)據(jù)、模型和部署的管線。
具身比自動駕駛更發(fā)散。每個場景差異更大,單一場景分布也更散。它石首先找大場景,比如線束,因為單一場景的ROI足夠大;第二,我們有自己的通用模型,隨著通用模型能力提升,擴新場景的邊際成本會下降。
這不是單純的數(shù)據(jù)問題、模型問題或者硬件問題。它是一個系統(tǒng)工程,是全棧能力的大考。任何一環(huán)薄弱,這個場景都可能變成毒藥。你做不透它,硬件不穩(wěn)定;針對這個場景做出來的東西又泛化不到其他場景;再擴新場景,投入產出比又特別低。
甲子光年:如果把具身任務放在一個光譜里,現(xiàn)在我們能看到的搬運、疊衣服、分揀、線束裝配分別處在什么位置?
丁文超:最簡單的是pick and place,也就是PP問題。不少仿真企業(yè)在PP問題上已經做得比較扎實,但要向更深層次邁進,會面臨很多挑戰(zhàn)。
PP往后,是泛PP問題,類似分揀。它沒有復雜長程任務,都是非常短程的,東西翻一下就可以,但有時需要局部微調。
再往后,任務長程性進一步提高,操作對象逐漸變成柔性物體,難度就更高。線束基本在這個區(qū)間:第一,它操作的是柔性東西;第二,它是長程任務;第三,它對成功率和節(jié)拍都有很高要求。
越往光譜左邊,越接近傳統(tǒng)工業(yè)自動化已經解決的問題,新創(chuàng)造的價值越低。越往中間甚至右邊走,傳統(tǒng)工業(yè)自動化夠不到,門檻越來越高,技術難度也越來越高。
![]()
它石智航A1機器人獲線束裝配吉尼斯世界紀錄稱號,圖片來源:它石智航
甲子光年:你在最近一次公開論壇上說,這一代具身智能要啃的是“柔性、動態(tài)和長程任務交互”。外界也會質疑,它石是不是擅長什么,就把什么定義成最難的賽道,你怎么回應?
丁文超:這不是由它石定義的,而是由市場定義的。反過來看,市場上還剩什么任務?給具身真正存留的是什么任務?
任何一條產線都有這個規(guī)律,簡單題、選擇題已經被傳統(tǒng)工業(yè)自動化做完了,剩下的難題和復雜題才空在那里。我們講的柔性、動態(tài)、長程任務,本質上就是這些空下來的大題。
當然,光譜中間的任務,將來它石也可能做。但我們的方法是靠模型能力外溢去覆蓋。就像海平面上升去淹沒小島,不是主動要淹沒它,但水位上來了,它可能順帶就被覆蓋了。
甲子光年:線束是觀察它石一個入口,你們整體的技術路線是什么時候定下的?
丁文超:2024年那個時間點對我們影響很大。我們發(fā)現(xiàn),行業(yè)里很少有人把這件事想清楚,也沒有太多可參考的路線。
我們從第一性原理、top-down(從上到下)地去想。做具身核心就是一個三角形——它石的logo也是三角形——分別是數(shù)據(jù)、通用AI模型、核心零部件和終端應用。我們從第一天開始,就設定了這三個角,而且在每個角上都做了比較反常識的選擇。
我們最初覺得遙操作很難scale up,所以提出做human-centric數(shù)據(jù);其次是模型。2024年VLA很火,但我們覺得單純把一個action的頭拼進VLM里,不是終極架構,所以提出了AI World Engine(AWE);然后是應用,模型早期要找到ROI最大、同時適合這一代具身智能的場景,我們去了很多工廠,最后找到了線束。
甲子光年:外界對它石的技術路線有沒有誤讀?
丁文超:外界怎么看待不是我最關注的。它石最終讓人信服的,不是我們技術路線多好,或者某一個點怎么樣。大家怎么看技術路線只是一方面,最終還是要發(fā)揮生產價值。
客戶和產品、是否真的實現(xiàn)落地和創(chuàng)造價值才是第一性原理。自動駕駛雖然現(xiàn)在還有人討論兩段式端到端、一段式端到端,但實際上比的還是誰的車開得好。具身可能很快,在2026、2027年也會進入這種狀態(tài)。
2.智駕團隊做具身是降維打擊?
甲子光年:最近一年很多自動駕駛團隊進入具身行業(yè),有人會說這是降維打擊。但機器人畢竟不是車,哪些自動駕駛經驗不能直接搬到具身里?
丁文超:這是一個很好的問題,我不覺得自動駕駛在技術路線上給具身多少直接借鑒。真正有價值的,是自動駕駛沉淀下來的一套數(shù)據(jù)閉環(huán)體系。
自動駕駛最后沉淀下來的,不是某個技術棧。對我來說,最大的收獲是學會了通過海量數(shù)據(jù)、用戶問題,提高產品力,讓一個物理AI產品在物理空間里達到可靠、可信賴。這個方法論和具身是共享的。
但具體技術問題差異很大。自動駕駛是在物理空間里不要接觸任何東西,本質上是從A到B,但不要和任何東西發(fā)生接觸。具身恰恰相反,它一定要和東西發(fā)生接觸,并且知道接觸之后的結果是什么。
所有contact-rich manipulation(豐富接觸的操作)對模型特質的要求都和自動駕駛不一樣。很多人覺得車開得快,所以智駕對反應要求更高,但在狹小空間里做操作,具身對實時反應的要求反而更高。
甲子光年:具身智能發(fā)揮價值可以用什么指標來衡量?
丁文超:我會把具身指標定義成任務吞吐率。具身最終還是要發(fā)揮價值,說白了是GDP邏輯:單位時間能干多少事。
如果簡化成公式,任務吞吐率=任務成功率*任務完成效率*其他因子。
第一是任務成功率,這是基礎;第二是任務完成效率,也就是任務能不能達到人類水平。
甲子光年:你認為什么才是具身真正的“GPT時刻”?
丁文超:我們什么時候被GPT震驚到?是因為它干某件事居然比我還好,接近甚至超過我的水平。對應到機器人,任務完成效率也要非常高。很多demo動作很慢,效率可能只有人的30%。這不會讓人覺得GPT時刻到了。
什么時候一個任務叫打穿?就是成功率和效率都上來了,單位時間有效完成任務的吞吐率接近甚至超過人類。
我認為GPT時刻到來,不是一個任務打穿,而是若干任務都打穿,那一刻才真的來了。
甲子光年:同時打穿若干任務,核心聽起來不是單點demo,而是泛化。具身模型出現(xiàn)泛化或涌現(xiàn)能力時,會怎么表現(xiàn)?
丁文超:宏觀一點看,如果在一個新任務上,模型能打到八九十分,但需要的后訓練、特定數(shù)據(jù)采集或訓練被壓到最低,比如只需要分鐘級、幾十分鐘,或者小時級數(shù)據(jù),這就是很重要的泛化表現(xiàn)。
微觀一點看,泛化還會表現(xiàn)為模型涌現(xiàn)出一些不是監(jiān)督微調教出來的行為。比如它換了一個手,或者夾東西的方式和遙操作示教完全不一樣,自己判斷出另一條路徑完成任務。
3.世界模型怎么進入真實世界
甲子光年:你們一直強調世界模型,在ICRA 2026上,大家看到了VistaBot、TacForeSight這兩篇重點論文,以及自研靈巧手DexHand。這與世界模型的關聯(lián)在哪里?
丁文超:我覺得是順帶的。我們的核心還是前面講的三環(huán),但在這個過程中會有一些外溢。
去年我們發(fā)了視觸覺數(shù)據(jù)集,今年年初也發(fā)了一些開源模型,有些研發(fā)思路我們會通過論文、數(shù)據(jù)和模型向外傳遞。
VistaBot背后我們想提醒大家一個點:室內demo都很好,但一到新的地方、新的場景,就不敢展示復雜任務。
ICRA 2026現(xiàn)場很多展示要么是靜態(tài),要么是簡單pick and place,展示長程動態(tài)任務的很少,背后的原因就是泛化很難。
TacForeSight也是類似。我們很早就關注觸覺和力反饋的重要性。接觸豐富的操作對反應要求很高,單純30Hz或60Hz的視覺反饋已經不夠,末端會有遮擋,末端差幾毫米,最后接觸的狀態(tài)可能完全不對。
這些工作更多是生態(tài)和理念共享,也是在告訴大家,世界模型要進入真實任務,不能只停留在抽象預測里,它必須處理空間、接觸和反饋。
![]()
TacForeSight世界模型論文成果入選ICRA 2026,圖片來源:它石智航
甲子光年:VistaBot這篇論文里,未見視角的成功率從2%拉到68%。如果放到真實任務里,這意味著什么?它是怎么做到的?
丁文超:這牽扯到一個更系統(tǒng)的問題。論文里展示的是toy example:機械臂視角稍微變化,很多SOTA模型的成功率都會掉得非常多。
如果放到真實世界里,比如一家公司量產機器人時,會發(fā)現(xiàn)視覺和標定安裝存在一致性波動。機器人量產后,隨著使用生命周期延長,很多參數(shù)也會動態(tài)變化。機器人被推到新場景,和采集場景也會不一樣。
VistaBot這篇文章核心說的是,泛化需要找到一些統(tǒng)一的東西,也就是對空間的基礎認知能力,它可以極大增強抗擾動的泛化性,極大增加魯棒性。這個技巧我們內部經常用,現(xiàn)在通過論文展示出來。
甲子光年:68%如果要走向真實部署,離99%還有距離。后面要堆算力、數(shù)據(jù)繼續(xù)scaling嗎?
丁文超:這是一個非常好的問題,恰好反映了學術研究與工程落地在目標和路徑上的不同側重點。
作為一個學術工作,做到這里就結束了,因為它已經展示了巨大可能性,很多科研派公司也可能停在這里:告訴大家這種可能性存在,而且提升巨大,然后結束。但要把它系統(tǒng)化做成、做到scaling,中間還有巨大差異。你從一個簡單概念,到批量化scaling,背后還有很多工作。
作為工業(yè)化、批量化的任務和應用,你也不可能直接用一些off-the-shelf(現(xiàn)成的)模型,比如VGGT(一種前饋神經網絡)之類,這些模型不可控,沒法自己調優(yōu)。還要解決很多水面下的問題,更大的冰塊在水下。
甲子光年:視覺、觸覺、力反饋有時會“打架”,視覺判斷對準了,觸覺覺得異常,力控又觸發(fā)安全閾值。你們的模型怎么處理這種沖突?有明確的優(yōu)先級嗎?
丁文超:必須靠模型。這是一個非常典型的前融合還是后融合的問題。前融合意思就是說,多種信息都給到模型,讓模型判斷。后融合的邏輯就是,每個信源獨立處理,再加一些優(yōu)先級的調度或判斷。我們內部的共識很顯然應該是前融合的方式來做。
甲子光年:你們把TacForeSight稱為觸覺世界模型。它和其他公司的觸覺模型,只是定義不同,還是能力上也有區(qū)別?
丁文超:我覺得是兩個問題。
第一,我們做得比較多的是視覺和觸覺的前融合。機器人畢竟還是以視覺為主,單純觸覺世界模型能發(fā)揮的作用有限,觸覺更多是提供末端靈活的feedback。
第二,我們對觸覺的理解是:觸覺也是一種視覺,可以理解成指尖的視覺。如果把觸覺當成指尖視覺,就可以用世界模型去學習隱性的接觸規(guī)律,建立一個以接觸為核心的世界模型。它不只限于觸覺,將來還會融合視覺、接觸和力。
TacForeSight比較重要的一點,是把世界模型映射到動作這一步補上。現(xiàn)在很多人說自己有很強的世界模型,可以一直往前預測,但怎么用在動作、用在policy上,經常是缺失的,而這一步才是最難的。
以前大家用觸覺,往往只是編碼后扔進policy里。我覺得這不夠。我們想說的是,通過學習接觸的物理規(guī)律,模型不只是reactive的被動響應,而是能提前判斷未來動作會產生什么結果。化被動為主動,我覺得這才是世界模型最核心的意義。
甲子光年:業(yè)內也有人認為,觸覺傳感器易損壞、壽命短,真實工業(yè)場景里信號會退化,現(xiàn)在加大算法投入未必有收益。你認同嗎?
丁文超:客觀上說,現(xiàn)在觸覺硬件成熟度確實還有缺陷,但硬件穩(wěn)定性的進步非常快。觸覺有點像2023年看人形機器整機,當時關節(jié)有很多問題,諧波、行星等路線也不收斂,走也走不好,但很快它就收斂了。我個人判斷,觸覺將來會成為機器人的標準模態(tài)。
甲子光年:工業(yè)力控常常要求幾百甚至上千赫茲,但模型大腦可能只有幾十赫茲。物理接觸發(fā)生很快,幾十赫茲的模型怎么跟得上?
丁文超:這個問題很有意思。理論上policy頻率當然越快越好,但有一個收斂趨勢。
以前做人形locomotion(運動),大家會希望上層policy跑到100Hz、幾百Hz,底層關節(jié)控制到500Hz、1000Hz,甚至更高。因為傳統(tǒng)控制建模不準,頻率越高,越容易補誤差。
后來一個轉折點是,控制器充分神經網絡化之后,很多控制器頻率收斂到50Hz左右。網絡本身有魯棒性、冗余性和預判性。網絡訓練得越魯棒,對基礎頻率的要求會降低。
類比到操作,policy到50Hz左右,我覺得已經能建模很多快速微小變化,頻率提高只有在拿到的信息也更新時才有價值。
甲子光年:機器人每一次輸出都會變成物理動作,可能帶來損耗,甚至把東西拍壞。這些物理代價會怎么影響具身的scaling law?
丁文超:它肯定會增加scaling難度。
你想讓模型隱性學習到真實世界物理規(guī)律,相比純語言scaling,它有額外要求。這也是為什么我們布局觸覺、力反饋等能力,本質上是為了更好地建模真實世界反饋。
我們一直非常看重反饋,但我們又不太相信仿真器,因為仿真器基本要靠人工方式,很難scale。我們的預訓練數(shù)據(jù)是真實的Human-centric的數(shù)據(jù)。真機數(shù)據(jù)很少,遙操作數(shù)據(jù)也非常少。遙操作數(shù)據(jù)基本上只有真人動作上限的30%。
4.靈巧操作將進入深水區(qū)
甲子光年:ICRA 2026來了十幾家靈巧手公司,甚至一些靈巧手公司也開始說自己在做世界模型,為什么今年靈巧手和觸覺明顯變熱?這是一個拐點嗎?
丁文超:我覺得是一個拐點。
第一,對夾爪來說,雖然還沒有完全收斂,但走在最前面的人基本能感覺到,夾爪相關任務在2026年或2027年左右會被打穿。絕大多數(shù)靠夾爪單獨完成的任務,都會被刷到比較高的水平。
我們從第一天采數(shù)據(jù),就在采各個場景的數(shù)據(jù),也有手的數(shù)據(jù)。我們發(fā)現(xiàn)手相比夾爪確實有優(yōu)勢。靈巧手這件事,它的第一性原理必要性是存在的。
第二,低自由度靈巧手幾乎沒有價值。低自由度靈巧手和夾爪沒有本質區(qū)別。很多時候它需要高自由度,并且最終還是learning from human的問題。你怎么從人類數(shù)據(jù)里獲取最大能量,再用機械本體執(zhí)行這些動作,把人類數(shù)據(jù)和模型能力釋放出來。
我認為,接下來兩年,靈巧手硬件成本會被卷到很低,技術路線收斂也會比預期快,基本會往準直驅方向收斂。我們的定位是,模型、數(shù)據(jù),再加一個靈巧的終端,可能就是具身智能的全部。
前期各家看起來差不多,但靈巧操作上限太高,最后一定會進入深水區(qū)戰(zhàn)斗,必須三者協(xié)同。
![]()
它石智航DexHand靈巧手亮相ICRA 2026,圖片來源:它石智航
甲子光年:為什么夾爪還不夠?以線束或者其他任務為例,靈巧手要解決的是哪類問題?
丁文超:出發(fā)點倒不是這幾個已展示任務,而是更多任務。很多任務用夾爪做有難度,你也很難為每一個新任務設計一個特制夾爪。這里就有長尾效應:世界上可能80%的任務都可以靠夾爪完成,但剩下20%任務千奇百怪,你不可能為那20%完全做新的終端。
剩下的長尾任務最后可能就要靠靈巧手完成。比如我們之前用夾爪做刺繡。能不能像人的手一樣手工刺繡?我覺得這可能是靈巧手皇冠上的明珠。既能操作非常細的東西,也能完成長程任務,那基本上靈巧手就打穿了。
甲子光年:你提到模型、數(shù)據(jù)和靈巧終端必須一起協(xié)同。這個小閉環(huán)里,最難的地方在哪里?
丁文超:我不擔心硬件成本,因為硬件成本一定會往下降。這三者協(xié)同解決之后,大部分任務可能都會逐步替換夾爪式任務,特別是偏生活化的場景。
難度主要在于,模型到底怎么用好靈巧手。這個小閉環(huán)現(xiàn)在有缺位。比如靈巧手數(shù)據(jù)怎么獲取?如果單純ego-centric,又沒有反饋、沒有觸覺,可能還需要建立成體系的數(shù)據(jù)采集設備。
再往后,訓了模型,還要做人到機器人遷移,這是新的技術點;遷移到靈巧手上之后,還要有穩(wěn)定可靠的硬件執(zhí)行。我們一直講大的具身閉環(huán)是系統(tǒng)工程,回到靈巧手這個小閉環(huán)也是一樣。
甲子光年:靈巧手現(xiàn)在經常卷參數(shù),比如自由度、紋理感知精度等。哪些參數(shù)是剛需,哪些可能是過剩?如果不只看這些外顯參數(shù),應該比較什么?
丁文超:我覺得可以讓子彈再飛一會。
這塊核心競爭指標上,它石和其他幾家靈巧手公司有差異。很多靈巧手公司還是從硬件本體出發(fā)卷硬件,有點像2023年、2024年大家卷關節(jié),卷峰值扭矩、自由度。bottom-up(自下而上)的公司會這樣做,但這種方式肯定會遇到問題。
它石更多是自上而下地思考:我的數(shù)據(jù)分布是什么?模型輸出規(guī)格大概是什么?所以我的硬件應該怎么設計?
我們設計這個手的時候,分析了大量人類操作數(shù)據(jù)。這是我們和其他公司很大的差別。我們想做的是盡量縮小這只手和人手之間的差距:它實際能達到什么效果,它的硬件上限離人類上限還有多遠,我們是按這個角度來設計手的。
甲子光年:你們用了準直驅路線。和腱繩相比,這條路線最大的工程取舍是什么?發(fā)熱、損毀這些問題會成為瓶頸嗎?
丁文超:腱驅最大的意義,是如果你想讓這個手出很大的力,比如讓機器人做引體向上,腱驅可能很好,但我覺得這不是當前瓶頸。現(xiàn)在機器人的瓶頸還是靈巧操作的靈活性。不是要出特別大的力,而是能不能可控、標準化、靈活地操作。
從第一性原理講,我更看好準直驅方向,因為它追求靈活性、可復制性和穩(wěn)定量產性。腱驅最大的問題還是一致性以及量產難。
直驅確實是一套非常精密的系統(tǒng),電機設計、減速器設計都很極限。但這兩年進步已經非常多了,我不覺得它會成為瓶頸。它有點像2023年到2025年的locomotion硬件問題,早期很多問題,但收斂會很快。
硬件需要時間打磨,但不是不可解決的問題。把時間尺度拉長,看2025、2026年手的進步,還是非常快的,特別是選對大技術路線之后。
甲子光年:最近不少靈巧手公司的宣傳重點都是“手、采集、數(shù)據(jù)甚至模型的整套閉環(huán)”,怎么判斷是真的閉環(huán)?
丁文超:比如數(shù)據(jù)這件事,扎進去看,每家到底有多少數(shù)據(jù)?有哪些場景的數(shù)據(jù)?是不是可用?做到什么量級?這些差異非常大。
首先,數(shù)據(jù)量級只是一方面,場景豐富度和任務豐富度更關鍵。它石對豐富度要求非常高,比如單場景單任務采到一定數(shù)量后,這個任務、這個場景基本就不再采了,而是盡量往維度上擴,重復采集會影響數(shù)據(jù)的平衡。很多數(shù)采工廠一直抓瓶子,很快能積累非常多數(shù)據(jù),但對模型訓練未必有幫助,甚至可能有傷害。
從結果來看,要看展示出的任務多樣性。靈巧手demo的發(fā)布速度現(xiàn)在還很有限,遠沒有夾爪更新快,但我判斷接下來靈巧手任務多樣性的上升會很快。
我們內部當然有自己的評價體系,對外部評價體系沒有那么關注,最終還是回歸真實任務里的價值。
5.從“天才少年”到創(chuàng)業(yè)者
甲子光年:從此前的工作中,學到最大的經驗是什么?
丁文超:更多是產品化錘煉,所以一直很關心規(guī)模化效應,我最大的經驗是,一切東西都要能夠規(guī)模化。規(guī)模化不了,將來賣給用戶會很折磨。
我的起點一直是規(guī)模化。哪怕中間去到學術界,我更多思考的也是將來具身怎么做好規(guī)模化。到創(chuàng)業(yè)也是這樣,你會發(fā)現(xiàn)它石從一開始講的三角形,數(shù)據(jù)、模型、本體和應用,都是在想怎么規(guī)模化。
甲子光年:對你來說,從研究者、工程師變成創(chuàng)業(yè)者,最大的變化是什么?
丁文超:我之前智駕的經驗,更多是工程化思維。自動駕駛技術也經歷了整個收斂過程,我在那里學到的是,怎么把一個前沿技術bridge到可落地、規(guī)模化的產品上。每天接收用戶問題,思考怎么讓最先進的技術落下來。
2023年、2024年的間隙,我更多是從整個行業(yè)、新賽道角度給自己充能,跳出自動駕駛這個子場景,去想更通用的物理世界模型應該怎么構建數(shù)據(jù)、模型和閉環(huán)體系。
創(chuàng)業(yè)就是躬身入局。你要關心的事情非常多,很多事情不是別人能幫你做的。比如數(shù)據(jù),你找不到特別靠譜的數(shù)據(jù)供應商,那就得自己閉環(huán)。很多時候是從0開始。
但我還挺享受這個從0到1的過程。每天處理的問題當然很多。不管采集數(shù)據(jù)、訓練模型,還是閉環(huán)評測,機器人都是軟硬件協(xié)同系統(tǒng),每個地方都需要提升。
如果從局部微觀看,看到的都是問題。但如果把時間尺度拉長一點,看到的都是進展,就會讓人興奮。
甲子光年:過去一年,它石推進得很快。這種速度主要來自哪里?
丁文超:我現(xiàn)在感覺,具身這件事確實需要創(chuàng)始團隊稍微大一點。每個人的性格特質、能負責的事情都不一樣,剛好形成互補。技術、落地、商業(yè)化、組織管理、資本和投融資關系,每個角度都能找到一個創(chuàng)始人覆蓋,成為了一支“六邊形團隊”。
再加上創(chuàng)始人之間互信程度非常好,它石節(jié)奏能比較快。我們沒有花時間在內耗上。大部分問題不需要討論很久,憑創(chuàng)始團隊的默契,就知道事情該怎么推。我們開會頻率也沒那么高,大方向會同步,預期會同步,但很多細節(jié)上是充分互信的。
甲子光年:往未來12到18個月看,你覺得具身行業(yè)最可能被高估的是什么?最可能被低估的是什么?
丁文超:最被高估的,是特定模型架構對整個行業(yè)的影響。VLA也好,世界模型也好,某個特定模型架構對行業(yè)的影響沒有那么大。現(xiàn)在有AI coding,模型架構切換會變得很快。只要有一套成熟的完整迭代體系,模型架構切換是非常快的事情。
最低估的是系統(tǒng)化、全棧能力。這個環(huán)節(jié)里,只要有一個環(huán)節(jié)做不好,最終效果就發(fā)揮不出來,而且它可能給你導出錯誤結論。比如你以為問題是某個模型不行,但其實是觸覺、數(shù)據(jù)、硬件或者部署細節(jié)的問題。
甲子光年:如果未來要證明這條路線需要糾偏,最可能錯在哪里?或者你現(xiàn)在最盯著的風險是什么?
丁文超:從我的角度看,它石的技術路線沒有bet(押注)到某一個非常具體的技術細節(jié)上。我們講的更多是模型和數(shù)據(jù)的第一性原理以及整個商業(yè)化邏輯。除非這些第一性原理被推翻,我現(xiàn)在還沒有看到大的風險。重劍無鋒,大巧不工。
甲子光年:它石(TARS)和《星際穿越》里的機器人同名。那個機器人有一個幽默感參數(shù)。如果給你這一年也設置一個參數(shù),哪一個值被調到了最高?
丁文超:我覺得是敏捷,或者說快。過去這一年,我們核心是天下武功,唯快不破。快很重要。因為我們對top-down的思考已經想得比較清楚了,接下來就是快。
*實習作者寇雨然對本文亦有貢獻。
(封面圖:《星際穿越》劇照)
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.