henry 發(fā)自 凹非寺
量子位 | 公眾號(hào) QbitAI
機(jī)器人,也開(kāi)始擁有“觸覺(jué)想象力”了。
過(guò)去一年,隨著具身基礎(chǔ)模型的快速發(fā)展,機(jī)器人已經(jīng)能完成不少輪廓清晰、位置明確的操作任務(wù)。
可一旦涉及柔性物體、易損物體或密集接觸,機(jī)器人往往就開(kāi)始力不從“腦”。
![]()
無(wú)論是捏起一顆葡萄而不將它捏破,還是抓住一只紙杯而不讓它變形,視覺(jué)只能幫助機(jī)器人找到目標(biāo),想要完成任務(wù),機(jī)器人還需要人類與物體交互時(shí)不可或缺的觸覺(jué)感知。
也正因?yàn)槿绱耍F(xiàn)在也有越來(lái)越多團(tuán)隊(duì)開(kāi)始將觸覺(jué)作為建構(gòu)機(jī)器人大腦的重要模態(tài)。比如,UniTouch、AnyTouch嘗試統(tǒng)一不同傳感器的觸覺(jué)表征,F(xiàn)uSe、Tactile-VLA把觸覺(jué)送進(jìn)通用策略與VLA,近期的TacImag則開(kāi)始探索讓機(jī)器人僅憑視覺(jué)和本體感覺(jué)“想象”觸覺(jué);NVIDIA也推出TacSL等視覺(jué)觸覺(jué)仿真工具,加速觸覺(jué)策略從仿真走向真機(jī)。
但這些路線仍各有邊界:傳感器異構(gòu)讓數(shù)據(jù)難以互通,觸覺(jué)理解、生成與動(dòng)作應(yīng)用也往往分散在不同模型中。
最近,UniX AI(優(yōu)理奇機(jī)器人)聯(lián)合浙江大學(xué)、麻省理工、牛津、耶魯以及上海交通大學(xué),發(fā)布最新科研成果UniTac,提出一套統(tǒng)一的跨傳感器觸覺(jué)理解與生成架構(gòu),并進(jìn)一步接入VLA,為機(jī)器人補(bǔ)上了“觸覺(jué)想象力”。
![]()
(該工作已被ECCV 2026接收)
簡(jiǎn)單來(lái)說(shuō),UniTac讓機(jī)器人獲得了一種未觸先感的能力,可以讓機(jī)器人像人一樣,在真正碰到物體之前,先“想象”出它摸起來(lái)是什么感覺(jué),再?zèng)Q定怎么下手。
比如,面對(duì)一個(gè)軟杯,機(jī)器人會(huì)先預(yù)測(cè)它受力后的形變,再?zèng)Q定從哪里接觸、該用多大力。
![]()
對(duì)比來(lái)看,在未融合UniTac的情況下,VLA就會(huì)將紙杯捏扁。
![]()
這意味著,對(duì)于機(jī)器人來(lái)說(shuō),觸覺(jué)第一次從碰到以后才知道”,變成了碰到之前就能預(yù)測(cè)。
而這背后,也對(duì)應(yīng)著具身智能正在補(bǔ)上的一塊重要能力:觸覺(jué)。
機(jī)器人為什么需要學(xué)會(huì)“未觸先感”?
如果把過(guò)去幾年機(jī)器人基礎(chǔ)模型的發(fā)展,看作一個(gè)不斷把AI錨定到真實(shí)世界(grounding)的過(guò)程,那么我們大致可以將其分為三層。
![]()
VLM(視覺(jué)-語(yǔ)言模型)完成的是第一層grounding:把抽象的語(yǔ)言概念對(duì)應(yīng)到現(xiàn)實(shí)世界,讓機(jī)器人知道眼前看到的是什么;
VLA(視覺(jué)-語(yǔ)言-動(dòng)作模型)再往前一步,把視覺(jué)語(yǔ)義和語(yǔ)言指令錨定到動(dòng)作(軌跡),讓機(jī)器人知道在任務(wù)場(chǎng)景時(shí)應(yīng)該規(guī)劃怎樣的軌跡。
可當(dāng)動(dòng)作真正落地到物理世界時(shí),往往還差著第三層grounding——
機(jī)器人必須知道,應(yīng)該怎樣完成這次接觸。
因?yàn)閷?duì)于機(jī)器人來(lái)說(shuō),“抓取”只是一個(gè)動(dòng)作標(biāo)簽,但現(xiàn)實(shí)里的每一次接觸,卻完全不同。
抓起一塊毛巾,需要判斷哪里更容易捏住,毛巾的材質(zhì)、大小、形狀、表面粗糙程度都會(huì)導(dǎo)致機(jī)器人抓錯(cuò)或抓取失敗;
例如,在未接入U(xiǎn)niTac時(shí),VLA就無(wú)法抓起下圖所示的橙色毛巾。
也就是說(shuō),真正決定機(jī)器人操作成功與否的,不只是軌跡,而是接觸過(guò)程本身。而這,正是當(dāng)前VLA模型面對(duì)柔性物體、易損物體和接觸密集型任務(wù)時(shí)的短板:
動(dòng)作生成缺少對(duì)接觸過(guò)程的預(yù)判與理解
完全依賴視覺(jué),機(jī)器人很容易對(duì)外觀相似的物體采用同一套操作策略。而且如果等到接觸發(fā)生后再根據(jù)觸覺(jué)反饋修正,紙杯可能已經(jīng)癟了,薯片也可能已經(jīng)碎了。
所以,如果機(jī)器人能夠在真正碰到之前,就已經(jīng)知道未來(lái)的觸覺(jué)狀態(tài),那么第一次接觸,就會(huì)變得安全得多。
為了實(shí)現(xiàn)這一點(diǎn),UniTac先從大規(guī)模、多傳感器數(shù)據(jù)中學(xué)習(xí)統(tǒng)一的觸覺(jué)表征,再根據(jù)視覺(jué)信息預(yù)測(cè)潛在觸覺(jué)狀態(tài),把觸覺(jué)從“接觸后的反饋”前移成“接觸前的先驗(yàn)”,并送入VLA。
值得一提的是,這并沒(méi)有取代接觸后的實(shí)時(shí)反饋,而是在第一次下手之前,讓機(jī)器人先預(yù)判這次接觸可能帶來(lái)的物理后果。
比如,在同樣面對(duì)兩塊看起來(lái)差不多的毛巾時(shí),基于UniTac的基礎(chǔ)模型,就能提前預(yù)判毛巾的質(zhì)感、顏色,從而規(guī)劃、完成毛巾的單層抓取動(dòng)作。
接下來(lái),我們具體來(lái)看UniTac是怎么做到的。
跨傳感器的理解與生成
為了讓觸覺(jué)進(jìn)入基礎(chǔ)模型,UniTac先處理了最難統(tǒng)一的數(shù)據(jù)問(wèn)題。
觸覺(jué)圖像雖然看起來(lái)很像RGB圖像,但產(chǎn)生方式卻完全不同。
以GelSight、DIGIT、Duragel等視覺(jué)式觸覺(jué)傳感器為例,它們本質(zhì)上是通過(guò)相機(jī)記錄凝膠受壓后的形變。
![]()
所以,一張觸覺(jué)圖像里通常混著兩類信息:一類來(lái)自物體,包括硬度、粗糙度、紋理和接觸形變;另一類來(lái)自傳感器,包括光照、凝膠狀態(tài)、Marker布局和相機(jī)參數(shù)。
這意味著,同一個(gè)物體,換一種觸覺(jué)傳感器,得到的數(shù)據(jù)可能完全不同。模型如果分不清哪些變化來(lái)自物體、哪些來(lái)自傳感器,就很難實(shí)現(xiàn)跨設(shè)備泛化。
與此同時(shí),過(guò)去的觸覺(jué)模型大多建立在單一傳感器或小規(guī)模數(shù)據(jù)集上。
比如PHYSICLEAR只有482段觸覺(jué)視頻,而整個(gè)社區(qū)其實(shí)已經(jīng)公開(kāi)了超過(guò)40萬(wàn)段觸覺(jué)視頻、160萬(wàn)幀數(shù)據(jù)。
這就是說(shuō),真正的問(wèn)題并不是沒(méi)有數(shù)據(jù),而是這些數(shù)據(jù)長(zhǎng)期分散在不同傳感器、不同數(shù)據(jù)集和不同任務(wù)中,無(wú)法被統(tǒng)一利用。
為解決這些問(wèn)題,UniTac把觸覺(jué)理解和觸覺(jué)生成放進(jìn)同一個(gè)多模態(tài)框架,統(tǒng)一吸收來(lái)自不同傳感器的數(shù)據(jù)。
具體來(lái)說(shuō),UniTac將觸覺(jué)拆分成兩個(gè)部分:物理屬性和傳感器配置。
前者描述物體在接觸中呈現(xiàn)出的硬度、粗糙度和紋理等屬性;后者刻畫(huà)傳感器的光照、凝膠狀態(tài)、Marker布局和相機(jī)參數(shù)等配置。
而UniTac的整體架構(gòu),就圍繞這兩方面展開(kāi)。
![]()
理解端,模型同時(shí)學(xué)習(xí)物體屬性描述和傳感器識(shí)別。前一個(gè)任務(wù)讓模型理解表面屬性,后一個(gè)任務(wù)讓模型辨認(rèn)信號(hào)來(lái)自哪種設(shè)備。
這里之所以增加傳感器識(shí)別,并非單純多做一道題,它迫使模型區(qū)分,哪些變化來(lái)自物體,哪些變化來(lái)自傳感器。
從下圖我們可以看到,面對(duì)不同傳感器采集的觸覺(jué)視頻,UniTac已經(jīng)能夠圍繞硬度、粗糙度和紋理,生成與接觸材料相符的描述,并能完成屬性比較、物體匹配和極值選擇等推理任務(wù)。
![]()
生成端,UniTac則分兩步訓(xùn)練。
模型先訓(xùn)練觸覺(jué)解碼器,學(xué)習(xí)重建真實(shí)觸覺(jué)信號(hào);再用Sensor-Aware DiT Projector,將MLLM的語(yǔ)義輸出對(duì)齊到觸覺(jué)latent空間,并加入對(duì)應(yīng)的傳感器token。
生成觸覺(jué)時(shí),UniTac還改掉了普通生成模型常用的“無(wú)條件分支”。
原因很簡(jiǎn)單,研究發(fā)現(xiàn)觸覺(jué)其實(shí)不存在真正的無(wú)條件狀態(tài)。任何一段觸覺(jué)信號(hào),都由某個(gè)具體傳感器產(chǎn)生。
因此,UniTac先給定目標(biāo)傳感器未接觸物體時(shí)的狀態(tài),再生成接觸發(fā)生后,由物體屬性帶來(lái)的變化。
最后,實(shí)驗(yàn)結(jié)果進(jìn)一步表明,UniTac并非只在某項(xiàng)指標(biāo)上實(shí)現(xiàn)單點(diǎn)領(lǐng)先,而是在觸覺(jué)理解與觸覺(jué)生成兩端都展現(xiàn)出優(yōu)勢(shì)。
在觸覺(jué)理解方面,UniTac-7B在PHYSICLEAR-Test上以66.51分領(lǐng)先Octopi等觸覺(jué)理解模型,以及BLIP3o等統(tǒng)一模型。
具體的,在屬性—物體匹配任務(wù)中,UniTac-7B取得64.61分,這說(shuō)明它不僅能識(shí)別軟硬、粗糙度等物理屬性,還能進(jìn)一步判斷觸覺(jué)來(lái)自哪類物體。
![]()
在觸覺(jué)生成方面,UniTac同樣表現(xiàn)優(yōu)異。
面對(duì)Digit、GelSight、GelSight Mini和Duragel四類傳感器,UniTac的平均SSIM和PSNR分別達(dá)到,均取得最佳結(jié)果。
![]()
正是這種穩(wěn)定的跨傳感器生成能力,讓它可以進(jìn)一步為VLA提供觸覺(jué)先驗(yàn),幫助機(jī)器人判斷該怎樣更安全地接觸目標(biāo)。
深耕觸覺(jué)路線
最后,讓我們?cè)侔岩暯抢氐経niTac背后的團(tuán)隊(duì),優(yōu)理奇機(jī)器人(UniX AI)。
這家全棧式具身智能公司由00后耶魯博士楊豐瑜,于2024年4月創(chuàng)立于蘇州。
![]()
在UniTac論文中,楊豐瑜擔(dān)任共同一作,延續(xù)其在視觸覺(jué)方向的技術(shù)路線。
另一位共同一作Jiahang Tu來(lái)自浙江大學(xué),研究集中在計(jì)算機(jī)視覺(jué)與生成模型;
通訊作者Hanbin Zhao現(xiàn)任浙江大學(xué)助理教授,長(zhǎng)期從事機(jī)器學(xué)習(xí)、計(jì)算機(jī)視覺(jué)和生成模型研究;來(lái)自UniX AI的Zhi Tao,則側(cè)重真機(jī)算法與系統(tǒng)落地。
此外,論文作者還包括牛津大學(xué)的Chenyang Ma、MIT的Xihang Yu、耶魯大學(xué)的Ziyao ZengAlex Wong,上海交通大學(xué)的Shaokai Wu等多位研究者,研究背景覆蓋觸覺(jué)表征、生成模型、VLA和真機(jī)操作。
把時(shí)間線往前拉,優(yōu)理奇圍繞觸覺(jué)展開(kāi)的路線已經(jīng)相當(dāng)清晰。
從Touch and Go采集真實(shí)世界的視觸覺(jué)數(shù)據(jù),到UniTouch統(tǒng)一多傳感器表征,再到TaRF把視覺(jué)與觸覺(jué)對(duì)齊到三維空間,團(tuán)隊(duì)始終在推進(jìn)同一件事:讓機(jī)器人從看見(jiàn)物體,走向理解物體該如何被接觸。
最新的UniTac則把這條路線繼續(xù)推向基礎(chǔ)模型,將觸覺(jué)理解、生成和跨傳感器遷移納入統(tǒng)一架構(gòu),并把預(yù)測(cè)到的觸覺(jué)狀態(tài)接入到像VLA這樣的機(jī)器人基礎(chǔ)模型上。
這一步也延續(xù)了優(yōu)理奇一貫的場(chǎng)景驅(qū)動(dòng)思路。
從其產(chǎn)品與技術(shù)演進(jìn)來(lái)看,團(tuán)隊(duì)關(guān)心的不只是機(jī)器人“能不能干活”,還包括能否把活干好、干得更穩(wěn)定高效。與其針對(duì)每個(gè)場(chǎng)景微調(diào),不如從真實(shí)任務(wù)的痛點(diǎn)出發(fā),持續(xù)補(bǔ)齊感知、控制與系統(tǒng)能力。
因此,當(dāng)行業(yè)集中攻關(guān)VLA和世界模型時(shí),優(yōu)理奇選擇補(bǔ)上的是機(jī)器人進(jìn)入物理世界時(shí)繞不開(kāi)的接觸層。
UniTac的意義,正是把不同場(chǎng)景中的接觸問(wèn)題,沉淀為一種可以跨傳感器復(fù)用、也能參與動(dòng)作決策的基礎(chǔ)能力。
在未來(lái),隨著視覺(jué)、觸覺(jué)、力覺(jué)與動(dòng)作模型進(jìn)一步融合,機(jī)器人有望在家庭護(hù)理、精細(xì)裝配、服務(wù)操作和康養(yǎng)陪護(hù)等場(chǎng)景中,完成更安全、更柔順的接觸操作。
參考鏈接[1]https://arxiv.org/abs/2606.31451
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.