henry 發自 凹非寺
量子位 | 公眾號 QbitAI
機器人,也開始擁有“觸覺想象力”了。
過去一年,隨著具身基礎模型的快速發展,機器人已經能完成不少輪廓清晰、位置明確的操作任務。
可一旦涉及柔性物體、易損物體或密集接觸,機器人往往就開始力不從“腦”。
![]()
無論是捏起一顆葡萄而不將它捏破,還是抓住一只紙杯而不讓它變形,視覺只能幫助機器人找到目標,想要完成任務,機器人還需要人類與物體交互時不可或缺的觸覺感知。
也正因為如此,現在也有越來越多團隊開始將觸覺作為建構機器人大腦的重要模態。比如,UniTouch、AnyTouch嘗試統一不同傳感器的觸覺表征,FuSe、Tactile-VLA把觸覺送進通用策略與VLA,近期的TacImag則開始探索讓機器人僅憑視覺和本體感覺“想象”觸覺;NVIDIA也推出TacSL等視覺觸覺仿真工具,加速觸覺策略從仿真走向真機。
但這些路線仍各有邊界:傳感器異構讓數據難以互通,觸覺理解、生成與動作應用也往往分散在不同模型中。
最近,UniX AI(優理奇機器人)聯合浙江大學、麻省理工、牛津、耶魯以及上海交通大學,發布最新科研成果UniTac,提出一套統一的跨傳感器觸覺理解與生成架構,并進一步接入VLA,為機器人補上了“觸覺想象力”。
![]()
(該工作已被ECCV 2026接收)
簡單來說,UniTac讓機器人獲得了一種未觸先感的能力,可以讓機器人像人一樣,在真正碰到物體之前,先“想象”出它摸起來是什么感覺,再決定怎么下手。
比如,面對一個軟杯,機器人會先預測它受力后的形變,再決定從哪里接觸、該用多大力。
![]()
對比來看,在未融合UniTac的情況下,VLA就會將紙杯捏扁。
![]()
這意味著,對于機器人來說,觸覺第一次從碰到以后才知道”,變成了碰到之前就能預測。
而這背后,也對應著具身智能正在補上的一塊重要能力:觸覺。
機器人為什么需要學會“未觸先感”?
如果把過去幾年機器人基礎模型的發展,看作一個不斷把AI錨定到真實世界(grounding)的過程,那么我們大致可以將其分為三層。
![]()
VLM(視覺-語言模型)完成的是第一層grounding:把抽象的語言概念對應到現實世界,讓機器人知道眼前看到的是什么;
VLA(視覺-語言-動作模型)再往前一步,把視覺語義和語言指令錨定到動作(軌跡),讓機器人知道在任務場景時應該規劃怎樣的軌跡。
可當動作真正落地到物理世界時,往往還差著第三層grounding——
機器人必須知道,應該怎樣完成這次接觸。
因為對于機器人來說,“抓取”只是一個動作標簽,但現實里的每一次接觸,卻完全不同。
抓起一塊毛巾,需要判斷哪里更容易捏住,毛巾的材質、大小、形狀、表面粗糙程度都會導致機器人抓錯或抓取失敗;
例如,在未接入UniTac時,VLA就無法抓起下圖所示的橙色毛巾。
也就是說,真正決定機器人操作成功與否的,不只是軌跡,而是接觸過程本身。而這,正是當前VLA模型面對柔性物體、易損物體和接觸密集型任務時的短板:
動作生成缺少對接觸過程的預判與理解
完全依賴視覺,機器人很容易對外觀相似的物體采用同一套操作策略。而且如果等到接觸發生后再根據觸覺反饋修正,紙杯可能已經癟了,薯片也可能已經碎了。
所以,如果機器人能夠在真正碰到之前,就已經知道未來的觸覺狀態,那么第一次接觸,就會變得安全得多。
為了實現這一點,UniTac先從大規模、多傳感器數據中學習統一的觸覺表征,再根據視覺信息預測潛在觸覺狀態,把觸覺從“接觸后的反饋”前移成“接觸前的先驗”,并送入VLA。
值得一提的是,這并沒有取代接觸后的實時反饋,而是在第一次下手之前,讓機器人先預判這次接觸可能帶來的物理后果。
比如,在同樣面對兩塊看起來差不多的毛巾時,基于UniTac的基礎模型,就能提前預判毛巾的質感、顏色,從而規劃、完成毛巾的單層抓取動作。
接下來,我們具體來看UniTac是怎么做到的。
跨傳感器的理解與生成
為了讓觸覺進入基礎模型,UniTac先處理了最難統一的數據問題。
觸覺圖像雖然看起來很像RGB圖像,但產生方式卻完全不同。
以GelSight、DIGIT、Duragel等視覺式觸覺傳感器為例,它們本質上是通過相機記錄凝膠受壓后的形變。
![]()
所以,一張觸覺圖像里通常混著兩類信息:一類來自物體,包括硬度、粗糙度、紋理和接觸形變;另一類來自傳感器,包括光照、凝膠狀態、Marker布局和相機參數。
這意味著,同一個物體,換一種觸覺傳感器,得到的數據可能完全不同。模型如果分不清哪些變化來自物體、哪些來自傳感器,就很難實現跨設備泛化。
與此同時,過去的觸覺模型大多建立在單一傳感器或小規模數據集上。
比如PHYSICLEAR只有482段觸覺視頻,而整個社區其實已經公開了超過40萬段觸覺視頻、160萬幀數據。
這就是說,真正的問題并不是沒有數據,而是這些數據長期分散在不同傳感器、不同數據集和不同任務中,無法被統一利用。
為解決這些問題,UniTac把觸覺理解和觸覺生成放進同一個多模態框架,統一吸收來自不同傳感器的數據。
具體來說,UniTac將觸覺拆分成兩個部分:物理屬性和傳感器配置。
前者描述物體在接觸中呈現出的硬度、粗糙度和紋理等屬性;后者刻畫傳感器的光照、凝膠狀態、Marker布局和相機參數等配置。
而UniTac的整體架構,就圍繞這兩方面展開。
![]()
理解端,模型同時學習物體屬性描述和傳感器識別。前一個任務讓模型理解表面屬性,后一個任務讓模型辨認信號來自哪種設備。
這里之所以增加傳感器識別,并非單純多做一道題,它迫使模型區分,哪些變化來自物體,哪些變化來自傳感器。
從下圖我們可以看到,面對不同傳感器采集的觸覺視頻,UniTac已經能夠圍繞硬度、粗糙度和紋理,生成與接觸材料相符的描述,并能完成屬性比較、物體匹配和極值選擇等推理任務。
![]()
生成端,UniTac則分兩步訓練。
模型先訓練觸覺解碼器,學習重建真實觸覺信號;再用Sensor-Aware DiT Projector,將MLLM的語義輸出對齊到觸覺latent空間,并加入對應的傳感器token。
生成觸覺時,UniTac還改掉了普通生成模型常用的“無條件分支”。
原因很簡單,研究發現觸覺其實不存在真正的無條件狀態。任何一段觸覺信號,都由某個具體傳感器產生。
因此,UniTac先給定目標傳感器未接觸物體時的狀態,再生成接觸發生后,由物體屬性帶來的變化。
最后,實驗結果進一步表明,UniTac并非只在某項指標上實現單點領先,而是在觸覺理解與觸覺生成兩端都展現出優勢。
在觸覺理解方面,UniTac-7B在PHYSICLEAR-Test上以66.51分領先Octopi等觸覺理解模型,以及BLIP3o等統一模型。
具體的,在屬性—物體匹配任務中,UniTac-7B取得64.61分,這說明它不僅能識別軟硬、粗糙度等物理屬性,還能進一步判斷觸覺來自哪類物體。
![]()
在觸覺生成方面,UniTac同樣表現優異。
面對Digit、GelSight、GelSight Mini和Duragel四類傳感器,UniTac的平均SSIM和PSNR分別達到,均取得最佳結果。
![]()
正是這種穩定的跨傳感器生成能力,讓它可以進一步為VLA提供觸覺先驗,幫助機器人判斷該怎樣更安全地接觸目標。
深耕觸覺路線
最后,讓我們再把視角拉回到UniTac背后的團隊,優理奇機器人(UniX AI)。
這家全棧式具身智能公司由00后耶魯博士楊豐瑜,于2024年4月創立于蘇州。
![]()
在UniTac論文中,楊豐瑜擔任共同一作,延續其在視觸覺方向的技術路線。
另一位共同一作Jiahang Tu來自浙江大學,研究集中在計算機視覺與生成模型;
通訊作者Hanbin Zhao現任浙江大學助理教授,長期從事機器學習、計算機視覺和生成模型研究;來自UniX AI的Zhi Tao,則側重真機算法與系統落地。
此外,論文作者還包括牛津大學的Chenyang Ma、MIT的Xihang Yu、耶魯大學的Ziyao ZengAlex Wong,上海交通大學的Shaokai Wu等多位研究者,研究背景覆蓋觸覺表征、生成模型、VLA和真機操作。
把時間線往前拉,優理奇圍繞觸覺展開的路線已經相當清晰。
從Touch and Go采集真實世界的視觸覺數據,到UniTouch統一多傳感器表征,再到TaRF把視覺與觸覺對齊到三維空間,團隊始終在推進同一件事:讓機器人從看見物體,走向理解物體該如何被接觸。
最新的UniTac則把這條路線繼續推向基礎模型,將觸覺理解、生成和跨傳感器遷移納入統一架構,并把預測到的觸覺狀態接入到像VLA這樣的機器人基礎模型上。
這一步也延續了優理奇一貫的場景驅動思路。
從其產品與技術演進來看,團隊關心的不只是機器人“能不能干活”,還包括能否把活干好、干得更穩定高效。與其針對每個場景微調,不如從真實任務的痛點出發,持續補齊感知、控制與系統能力。
因此,當行業集中攻關VLA和世界模型時,優理奇選擇補上的是機器人進入物理世界時繞不開的接觸層。
UniTac的意義,正是把不同場景中的接觸問題,沉淀為一種可以跨傳感器復用、也能參與動作決策的基礎能力。
在未來,隨著視覺、觸覺、力覺與動作模型進一步融合,機器人有望在家庭護理、精細裝配、服務操作和康養陪護等場景中,完成更安全、更柔順的接觸操作。
參考鏈接[1]https://arxiv.org/abs/2606.31451
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.