![]()
過去幾年,無論是工業(yè)機(jī)器人還是人形機(jī)器人,視覺、模型和運動控制持續(xù)成為行業(yè)焦點。但在真實場景中,機(jī)器人要完成抓取、插拔、裝配、旋擰、處理柔性物體等任務(wù),真正決定成敗的往往并不是“看到了什么”,而是“接觸后如何調(diào)整動作、控制力度并穩(wěn)定執(zhí)行”。換句話說,機(jī)器人距離“像人一樣干活”,還缺一雙真正有“手感”的手。
成立于2024年的緯鈦機(jī)器人,以“視觸覺”傳感器為核心底座,向上延展至夾爪、靈巧手、整機(jī)末端、手眼協(xié)同算法和多模態(tài)數(shù)據(jù)采集設(shè)備,試圖為具身智能構(gòu)建一套圍繞“接觸智能”的底層基礎(chǔ)設(shè)施。
需要提及的是,緯鈦機(jī)器人創(chuàng)始人、CEO李瑞是“視觸覺”這一技術(shù)路線的重要開創(chuàng)者之一。據(jù)李瑞在2026天使投資大會上的演講介紹,他在MIT攻讀博士期間,與導(dǎo)師共同開創(chuàng)了機(jī)器人視觸覺研究方向,并發(fā)明出全球首款分辨率可超越人類手指的視觸覺傳感器。此后十余年間,團(tuán)隊圍繞該方向持續(xù)深耕,并推動這一原本偏學(xué)術(shù)的技術(shù)逐步走向產(chǎn)業(yè)化。
所謂“視觸覺”,即“基于視覺的觸覺傳感”其基本邏輯是,在傳感器內(nèi)部放置模擬人類手指的彈性體,當(dāng)彈性體接觸物體發(fā)生形變時,由內(nèi)置微型攝像頭捕捉圖像變化,再通過算法將其還原為力、紋理、滑動等觸覺信息。
與電阻、電容、霍爾效應(yīng)等傳統(tǒng)陣列式觸覺傳感方案相比,視觸覺的核心優(yōu)勢在于,它將觸覺問題轉(zhuǎn)化為圖像采集與計算問題,從而獲得遠(yuǎn)高于傳統(tǒng)方案的分辨率,并具備對法向力和切向力的多維感知能力。
這一路線的意義不止于“靈敏”。在工業(yè)和服務(wù)機(jī)器人場景中,許多高價值任務(wù)都依賴切向力信息。例如,USB或連接器插拔需要判斷是否對準(zhǔn)孔位、是否插到底;抓取不同材質(zhì)和形狀的物體需要實時判斷是否打滑;處理衣物、線纜和食品等柔性物體時,則需要更精細(xì)的接觸反饋。傳統(tǒng)系統(tǒng)中,不少所謂摩擦力或切向力數(shù)據(jù)往往依賴間接估算,而視觸覺則有機(jī)會提供更原生的接觸信息。對于具身智能而言,這意味著機(jī)器人控制系統(tǒng)第一次能夠以更接近人類方式理解“接觸”本身。
緯鈦機(jī)器人的商業(yè)化思路并非只停留在單一傳感器層面。根據(jù)公司介紹,其當(dāng)前產(chǎn)品體系大致分為三層:最底層是不同規(guī)格的視觸覺傳感器;中間層是搭載視觸覺的夾爪、靈巧手和末端執(zhí)行器;再往上則是結(jié)合機(jī)械臂、視覺系統(tǒng)和手眼協(xié)同算法的場景解決方案,以及多模態(tài)、跨本體的數(shù)據(jù)采集設(shè)備。公司推出的GF225、GF220等產(chǎn)品可裝配于夾爪,使傳統(tǒng)夾爪具備類人的感知能力;GF515則面向五指靈巧手場景,幫助靈巧手從“有結(jié)構(gòu)”走向“有手感”。
從應(yīng)用角度看,緯鈦機(jī)器人當(dāng)前主要瞄準(zhǔn)三類任務(wù):一是自適應(yīng)抓取,即面對不同大小、硬度、形狀和表面特性的物體時,機(jī)器人可以自行調(diào)整力度和姿態(tài);二是精準(zhǔn)放置、插拔、裝配、旋擰等高接觸任務(wù);三是柔性物體處理,如衣物、線纜和易碎食品等。
對資本市場而言,緯鈦機(jī)器人更值得關(guān)注的或許不是單個產(chǎn)品,而是它所處的位置。
公司投資方恒松資本董事長婁剛指出,具身智能未來無論采用何種上層模型和終端形態(tài),都繞不開手眼協(xié)同與接觸反饋,而原生切向力數(shù)據(jù)可能是其中最關(guān)鍵的底層入口之一。從這個角度看,緯鈦機(jī)器人所爭奪的不僅是一個傳感器市場,而可能是未來具身智能生態(tài)中的關(guān)鍵數(shù)據(jù)接口與能力標(biāo)準(zhǔn)。
這一點也解釋了公司在成立后迅速獲得資本關(guān)注的原因。根據(jù)公開信息,緯鈦機(jī)器人成立于2024年,成立以來已連續(xù)完成多輪融資,投資機(jī)構(gòu)包括小米戰(zhàn)投、恒松資本、祥峰、雅瑞、上海天使會等知名產(chǎn)業(yè)和財務(wù)投資機(jī)構(gòu)。
李瑞表示,新一輪融資正在順利推進(jìn)中,但具體融資金額、估值與輪次細(xì)節(jié)尚未正式對外披露。
在2026天使投資大會期間,「明亮公司」與李瑞進(jìn)行了一番交流,以下為精編整理后的訪談內(nèi)容:
![]()
李瑞(來源:受訪人提供)
觸覺傳感器關(guān)鍵是能讓機(jī)器人干活
Q:中國和全球范圍內(nèi)的具身智能或機(jī)器人,在進(jìn)入規(guī)模化和商業(yè)化的過程中,主要瓶頸是什么?觸覺傳感器在解決哪些核心問題?
李瑞:我喜歡從第一性原理思考。機(jī)器人要真正服務(wù)于千行百業(yè),需要具備的核心能力總結(jié)為“心靈手巧”。在手巧這部分,觸覺傳感器對人做很多操作是非常關(guān)鍵的。我們做90%以上的操作時,都需要手和眼的配合——觸覺能感知物體的性質(zhì)、大小、軟硬、形狀、重量,也能感知接觸狀態(tài)、法向力、切向力、滑動等信息。
如果只有視覺、沒有觸覺,你可以做一些demo,看著好像還行,但要穩(wěn)定落地、達(dá)到99.999%的成功率,觸覺是非常關(guān)鍵的閉環(huán)能力。所以我們做的東西不是可有可無的,而是未來機(jī)器人要實現(xiàn)像人一樣操作能力的必須品。我們是具身智能生態(tài)里非常核心的一個卡位。
Q:從整個價值鏈來講——大腦、小腦,還有具體的執(zhí)行末端——大概的價值分布是什么?您怎么看公司的市場空間和增長空間?
李瑞:大腦(心靈)和手(手巧)是硬幣的兩面,缺一不可。我們做的手巧,十幾年前就已經(jīng)有了技術(shù)儲備,但為什么到今天才開始落地?因為大模型來了,心靈這方面有了可能性,我們的手巧跟心靈搭配,才能讓機(jī)器人更好地干活。
從市場空間來講,一個通用機(jī)器人有兩只胳膊、兩只手,每只手就對應(yīng)多個觸覺傳感器。假設(shè)有100萬臺機(jī)器人(其實100萬臺不算多),就對應(yīng)1,000萬個傳感器、200萬只手。這個規(guī)模是非常大的。特斯拉公開說現(xiàn)在最難的部分就是手,這也印證了這個方向的重要性。
Q:有一種說法是做具身本體必須做全棧。作為一個關(guān)鍵部件的創(chuàng)新企業(yè),怎么看這一布局思路?
李瑞:大家會有不同的生態(tài)位——有的公司強(qiáng)調(diào)大腦,有的強(qiáng)調(diào)本體,有的強(qiáng)調(diào)手本身。我們做的是軟硬件結(jié)合、手眼協(xié)同——不僅僅是傳感器本身,我們還有手眼協(xié)同的軟件算法,讓傳感器和手真正結(jié)合起來能夠產(chǎn)生價值、能夠干活。我們一直強(qiáng)調(diào)的是“干活”,而不是說簡單的“我是一家傳感器公司”。我們研發(fā)人員有相當(dāng)一部分在做軟件算法,讓手眼協(xié)同、手眼腦結(jié)合,真正能做很多操作。
應(yīng)用場景:先ToB再ToC
Q:規(guī)模化落地的場景優(yōu)先級是什么?最優(yōu)先的場景在哪里?
李瑞:先ToB,再ToC。ToC最難,真的進(jìn)入千家萬戶,里面的難點非常多。ToB方面,工業(yè)場景、物流場景、商業(yè)場景等,相對可控,而且單價的價值量比較高,賬比較好算,所以相對更容易先落地。
從我們客戶的需求來講,分為三類:第一類是工業(yè)物流等ToB場景;第二類是靈巧手公司,我們提供核心傳感器以及配套的SDK和軟件算法;第三類是帶視觸覺的數(shù)采設(shè)備。這三方面需求現(xiàn)在都在爆發(fā)。
Q:能舉一個在工業(yè)場景里面的具體案例嗎?
李瑞:我們有非常多頭部制造業(yè)客戶,很多還沒有公開。可以說的一個例子是小米——他們已經(jīng)公開了,在手機(jī)生產(chǎn)線的某些環(huán)節(jié)用到了我們的技術(shù)和產(chǎn)品。
總體來講,我們對應(yīng)的場景可以分為三大類:
第一大類,自適應(yīng)抓取——什么東西都可以抓,就像小孩3歲以前就能抓各種食物、玩具,抓的種類可以特別多。物流分揀、上下料等都屬于這一類。
第二大類,精準(zhǔn)放置——不僅能抓起來,還能精準(zhǔn)地放到另外一個零部件上,對應(yīng)工業(yè)里的插拔裝配。就像小孩會拼樂高了,可以把一個樂高塊精準(zhǔn)放到另一個樂高塊上。
第三大類,柔性物體操作——衣服、線纜、食物等可變形物體。就像小孩會疊衣服、會做飯了。
具身智能賽道中國優(yōu)勢在于產(chǎn)業(yè)鏈、軟件算法、場景數(shù)據(jù)
Q:中國和美國在整個具身智能或人形機(jī)器人產(chǎn)業(yè)鏈上,差異主要在哪里?中國相對美國的優(yōu)勢是什么?
李瑞:美國總體上比較偏前沿性的軟件算法研究,偏“大腦”這一類。像Physical Intelligence(π)、Figure等,他們宣傳時強(qiáng)調(diào)的是大腦有多智能,會開源一些模型。中國則相對偏在硬件基礎(chǔ)上疊加軟件算法的產(chǎn)品化路徑。
中國的優(yōu)勢主要有三個:
第一,產(chǎn)業(yè)鏈優(yōu)勢。中國有非常豐富的上下游機(jī)器人產(chǎn)業(yè)鏈,可以快速迭代。從上春晚、翻跟頭,到現(xiàn)在機(jī)器人跑步速度超過人類,這都得益于中國豐富的供應(yīng)鏈,可以快速迭代。
第二,軟件算法前沿性。中國在軟件算法上也有非常多前沿研究,與美國的差距在縮小,在某些排行榜上,中國團(tuán)隊也會排在前面。
第三,場景數(shù)據(jù)優(yōu)勢。中國制造業(yè)非常發(fā)達(dá),可以把機(jī)器人快速落到產(chǎn)線上迭代;同時全國涌現(xiàn)出非常多的素材工廠,做大量數(shù)據(jù)采集,這些數(shù)據(jù)反過來反哺模型,讓模型更快速迭代。
當(dāng)然,無論是在中國還是美國做機(jī)器人或大模型,其實有相當(dāng)一部分是華人。某種程度上來講,中美之爭可能就是華人內(nèi)部的競爭。
Q:關(guān)于數(shù)據(jù),真實數(shù)據(jù)和生成數(shù)據(jù)、實采數(shù)據(jù)之間的關(guān)系,怎么看這兩類數(shù)據(jù)在訓(xùn)練的關(guān)系?
李瑞:從視頻數(shù)據(jù)、仿真數(shù)據(jù)到真實數(shù)據(jù),這幾種類型各有優(yōu)勢。現(xiàn)在的趨勢是越來越多地往真實數(shù)據(jù)方向發(fā)展。
主要有幾種:一是用機(jī)器人本體采集的遙操作數(shù)據(jù)(teleoperation),去年比較多,很多素材工廠以此為主;二是用UMI(Universal Manipulation Interface)采集,更輕便——人拿著設(shè)備就可以到不同的地方采集,不局限在實驗室,可以邊干活邊采集。在工廠里可以幾千、幾萬,甚至幾十萬人同時采集,量可以非常大;三是第一人稱視角數(shù)據(jù)(EGO-centric data),英偉達(dá)等公司也證實了這類數(shù)據(jù)的有效性。
不同數(shù)據(jù)的質(zhì)量和規(guī)模不一樣。有些數(shù)據(jù)容易采但質(zhì)量稍低,可以用來預(yù)訓(xùn)練(pre-train)一個基礎(chǔ)模型,再用更精準(zhǔn)的數(shù)據(jù)做fine-tuning(微調(diào))。
但無論哪種數(shù)據(jù),現(xiàn)在整個行業(yè)反映的普遍缺失模態(tài)就是觸覺。只靠視覺數(shù)據(jù)是不行的,必須把觸覺這個模態(tài)結(jié)合進(jìn)去,機(jī)器人在跟真實世界交互時,才能知道不同物體用多大的力、插拔是否到位、衣服有沒有扯壞、一瓶水是否拿穩(wěn)……這些都需要觸覺數(shù)據(jù)。尤其是插拔裝配這一類“contact rich(接觸密集型)”任務(wù)——這就是為什么富士康、立訊等企業(yè)還有幾十萬甚至上百萬工人,因為很多操作需要非常豐富的觸覺信息。
Q:數(shù)據(jù)規(guī)模上,現(xiàn)在整體處于什么階段?機(jī)器人的“GPT時刻”到底是什么時候?
李瑞:國外有一些代表性成果,比如“Generalist AI”系列,第一代用了約27萬小時的采集數(shù)據(jù),第二代(G-Zero和G-One)用了約50萬小時,用UMI采集。他們的模型在做新任務(wù)時,只需要很短時間的微調(diào)就可以上手,在某些任務(wù)上達(dá)到了90%以上的成功率。
但幾十萬小時夠不夠建立一個真正的具身智能基礎(chǔ)模型?我覺得遠(yuǎn)遠(yuǎn)不夠,大家還在探這個上限在哪里。
我們現(xiàn)在看的是:G-Zero這類算不算機(jī)器人的“GPT-1時刻”?如果算,那還有GPT-2、GPT-3、GPT-3.5……OpenAI從GPT-1到GPT-3.5中間又過了好幾年。機(jī)器人操作的數(shù)據(jù)不像語言,互聯(lián)網(wǎng)上沒有現(xiàn)成的大量積累,所以達(dá)到類似語言數(shù)據(jù)量級的時間肯定要更長。但方向已經(jīng)確定了,接下來就是怎么去scale up。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.