大數(shù)據(jù)文摘受權(quán)轉(zhuǎn)載自學(xué)術(shù)頭條
長期以來,計(jì)算機(jī)視覺領(lǐng)域主流的表征學(xué)習(xí)方法,如監(jiān)督判別、對(duì)比學(xué)習(xí)、自舉、自編碼等,幾乎都與生成式建模無關(guān)。早期的生成式視覺預(yù)訓(xùn)練雖展現(xiàn)出隨規(guī)模提升而增強(qiáng)的趨勢,但整體效果始終落后于非生成式方法。
與此同時(shí),圖像和視頻生成模型在過去一年展現(xiàn)出驚人的合成能力,也偶爾顯露出零樣本視覺理解的跡象。一個(gè)長期存在的猜想因此再次受到關(guān)注:能夠“創(chuàng)造”視覺內(nèi)容的模型,是否也具備“理解”視覺內(nèi)容的能力?此前的相關(guān)嘗試,要么難以讓生成模型按指令輸出可量化評(píng)估的結(jié)果,要么需要加入專門模塊并進(jìn)行全量微調(diào),從而犧牲通用性。
為回答這一問題,Google DeepMind 團(tuán)隊(duì)推出了 Vision Banana。這是一款以 Nano Banana Pro(NBP)為底座,并通過輕量指令微調(diào)打造的通用視覺模型。值得注意的是,何愷明、謝賽寧等學(xué)者也參與署名,這項(xiàng)工作在一定程度上代表了研究團(tuán)隊(duì)對(duì)通用視覺基礎(chǔ)模型方向的最新判斷。
![]()
論文鏈接:https://arxiv.org/pdf/2604.20329
核心結(jié)論很直接:只需在 NBP 原始訓(xùn)練數(shù)據(jù)中以極低比例混入視覺任務(wù)數(shù)據(jù),并將所有視覺任務(wù)的輸出統(tǒng)一重新參數(shù)化為 RGB 圖像,模型就能在 2D 與 3D 視覺理解的多項(xiàng) benchmark 上達(dá)到或超越 SAM 3、Depth Anything 3、Lotus-2 等專用模型,同時(shí)保留原有的圖像生成能力。
Vision Banana:生成即理解
Vision Banana 的方法靈感來自大語言模型(LLM)的訓(xùn)練范式。在自然語言處理中,生成式預(yù)訓(xùn)練產(chǎn)出“基礎(chǔ)模型”,而指令微調(diào)引導(dǎo)模型按照特定指令和格式生成文本。研究團(tuán)隊(duì)將這一思路運(yùn)用到視覺領(lǐng)域:把圖像生成模型作為“基礎(chǔ)模型”,通過指令微調(diào)讓它按照 prompt 要求生成指定格式的視覺輸出。
![]()
圖|研究團(tuán)隊(duì)通過對(duì) Nano Banana Pro 進(jìn)行指令微調(diào),揭示了圖像生成器潛在的視覺理解能力。經(jīng)過指令微調(diào)的模型 Vision Banana 能夠以精確的格式生成可視化結(jié)果,從而支持在主流基準(zhǔn)測試上進(jìn)行評(píng)估。
1.將視覺任務(wù)重構(gòu)為圖像生成
這是整個(gè)方法的核心創(chuàng)新。無論是分割掩碼、深度圖,還是表面法線,視覺任務(wù)的輸出都被統(tǒng)一參數(shù)化為 RGB 圖像。具體做法是設(shè)計(jì)一套“可解碼的可視化方案”,讓生成結(jié)果既能被人眼識(shí)別,也能通過明確規(guī)則逆向還原為物理量或語義標(biāo)簽。
以語義分割為例,研究團(tuán)隊(duì)給模型的 prompt 是“用純黃色 <255, 255, 0> 分割滑板類別”。評(píng)估時(shí),只需聚類所有接近 <255, 255, 0> 的像素,即可得到滑板的掩碼。
這種策略帶來三個(gè)關(guān)鍵優(yōu)勢:統(tǒng)一模型即可支持多種任務(wù),只需調(diào)整 prompt,無需修改權(quán)重;新增訓(xùn)練數(shù)據(jù)需求極低,指令微調(diào)主要是教模型如何將視覺結(jié)果格式化為 RGB 輸出;同時(shí)保留原始圖像生成能力,因?yàn)檩敵霰举|(zhì)上仍是 RGB 圖像。
2.輕量級(jí)指令微調(diào)策略
研究團(tuán)隊(duì)將視覺任務(wù)數(shù)據(jù)以極低比例混入 Nano Banana Pro 的原始訓(xùn)練數(shù)據(jù)中進(jìn)行聯(lián)合訓(xùn)練。低比例混合能夠確保視覺任務(wù)對(duì)齊不會(huì)破壞模型已有的生成先驗(yàn)。
2D 任務(wù)套件包括指代表達(dá)分割、語義分割和實(shí)例分割;3D 任務(wù)聚焦單目度量深度估計(jì)與表面法線估計(jì)。訓(xùn)練數(shù)據(jù)方面,2D 任務(wù)采用內(nèi)部模型對(duì)網(wǎng)絡(luò)圖像生成的標(biāo)注,3D 任務(wù)采用渲染引擎生成的合成數(shù)據(jù)。
關(guān)鍵在于,所有評(píng)測基準(zhǔn)對(duì)應(yīng)的訓(xùn)練數(shù)據(jù)均未被納入指令微調(diào)混合數(shù)據(jù)中,因此結(jié)果能夠更真實(shí)地反映模型的通用泛化能力。
3.深度值到 RGB 的可逆雙射
深度估計(jì)是論文中技術(shù)細(xì)節(jié)最集中的部分。深度值范圍是 [0, ∞),RGB 值域是 [0, 1]^3,如何在兩者之間建立可逆映射,是核心問題。
研究團(tuán)隊(duì)首先對(duì)深度值進(jìn)行 power transform,將近距離深度的分辨率拉高,同時(shí)壓縮遠(yuǎn)距離深度的分辨率,這也符合機(jī)器人抓取等任務(wù)中近處物體更重要的直覺。隨后,再將歸一化后的距離值沿 RGB 立方體邊緣進(jìn)行分段線性插值,方式類似 3D Hilbert 曲線的首次迭代。
由于這兩個(gè)變換都嚴(yán)格可逆,最終形成了從 [0, ∞] 到 [0, 1]^3 的雙射映射。訓(xùn)練階段,將 ground-truth 深度映射為 RGB 作為監(jiān)督目標(biāo);推理階段,再進(jìn)行反向解碼,即可恢復(fù)度量深度。
為提升魯棒性,訓(xùn)練數(shù)據(jù)還加入了 Plasma、Inferno、Viridis、灰度等多種替代色圖增強(qiáng)。值得注意的是,該深度模型完全基于合成數(shù)據(jù)訓(xùn)練,沒有使用任何真實(shí)世界深度數(shù)據(jù),同時(shí)訓(xùn)練與推理過程均不依賴相機(jī)內(nèi)外參。
效果怎么樣?
研究團(tuán)隊(duì)在 2D 分割、3D 深度估計(jì)、表面法線估計(jì)三類任務(wù)上,對(duì)比 Vision Banana 和各領(lǐng)域?qū)<夷P瓦M(jìn)行了全面評(píng)測。結(jié)果如下:
![]()
圖|經(jīng)過指令微調(diào)后,Vision Banana 在視覺生成與理解任務(wù)中的性能表現(xiàn)。
2D 分割:在 Cityscapes 語義分割任務(wù)中,Vision Banana 的 mIoU 達(dá)到 0.699,較 SAM 3 的 0.652 提升 4.7 個(gè)點(diǎn),成為表現(xiàn)最強(qiáng)的開放詞匯模型。在 RefCOCOg 指代分割任務(wù)中,cIoU 達(dá) 0.738,超過 SAM 3 Agent 的 0.734。在 ReasonSeg 推理分割任務(wù)中,配合 Google 的 Gemini 2.5 Pro 后,gIoU 達(dá) 0.793,高于 SAM 3 Agent 的 0.770,并超過了在訓(xùn)練集上訓(xùn)練的 X-SAM 和 LISA。實(shí)例分割是唯一稍弱的項(xiàng)目,在 SA-Co/Gold 上 pmF1 為 0.540,略低于 DINO-X 的 0.552。
![]()
表|Vision Banana 與各分割數(shù)據(jù)集上的 SOTA 方法的對(duì)比結(jié)果。
3D 深度估計(jì):在 6 個(gè)主流基準(zhǔn)上的平均 δ1 精度達(dá)到 0.882,較 UniK3D 提升近 6 個(gè)點(diǎn),AbsRel 較 MoGe-2 下降約 20%。在 Depth Anything 3 評(píng)測使用的四個(gè)數(shù)據(jù)集(NYU、ETH3D、DIODE、KITTI)上,Vision Banana 的平均 δ1 為 0.929,優(yōu)于 Depth Anything 3 的 0.918。
![]()
表|零樣本遷移設(shè)置下的單目度量深度估計(jì)結(jié)果。Vision Banana 在訓(xùn)練和推理階段均不使用相機(jī)內(nèi)參的情況下,在公開數(shù)據(jù)集上取得了更優(yōu)的結(jié)果。
表面法線估計(jì):在三個(gè)室內(nèi)數(shù)據(jù)集上,Vision Banana 取得最低平均角度誤差,mean 為 15.549,median 為 9.300,優(yōu)于 Lotus-2 的 mean 16.558。在戶外 VKitti 場景中,其表現(xiàn)與 Lotus-2 持平。值得注意的是,Lotus-2 曾在 Virtual KITTI 2 上進(jìn)行訓(xùn)練,而 Vision Banana 嚴(yán)格保持 zero-shot 設(shè)置。
![]()
表|表面法線估計(jì)結(jié)果。Vision Banana 在室內(nèi)數(shù)據(jù)集上平均取得了最低的均值和中值角度誤差,并在室外場景上與此前的 SOTA 方法持平。
生成能力保留:在 GenAI-Bench 文生圖對(duì)比中,Vision Banana 相對(duì)基礎(chǔ)模型 Nano Banana Pro 的勝率為 53.5%;在 ImgEdit 圖像編輯任務(wù)中,勝率為 47.8%。這表明經(jīng)過輕量級(jí) instruction-tuning 后,模型的生成能力依然保持穩(wěn)定。
還需要做什么?
研究團(tuán)隊(duì)表示,Vision Banana 并非完美,還需要在未來工作中持續(xù)改進(jìn)。
例如,Vision Banana 的實(shí)例分割性能仍落后于 SAM 3,在 SA-Co/Gold 數(shù)據(jù)集上仍有差距。論文指出,部分原因在于 Vision Banana 并未將 SA-Co 納入訓(xùn)練數(shù)據(jù),而 SAM 3 則基于該數(shù)據(jù)進(jìn)行訓(xùn)練。同時(shí),這項(xiàng)任務(wù)本身也對(duì)按類推理策略提出了挑戰(zhàn)。
計(jì)算開銷也是當(dāng)前的限制之一。研究團(tuán)隊(duì)指出,現(xiàn)階段使用 NBP 規(guī)模的圖像生成器進(jìn)行視覺理解,其推理成本高于輕量級(jí)專用模型。如果要大規(guī)模部署生成式視覺框架,仍需進(jìn)一步提升速度并降低成本。
目前的評(píng)估范圍僅限于單目圖像輸入,未來可拓展至多視角輸入和視頻輸入。研究視頻生成器是否能夠?qū)W習(xí)到更豐富的時(shí)間感知表征,也被視為值得探索的方向。擴(kuò)大 instruction-tuning 任務(wù)的多樣性,或許能像 LLM 一樣釋放更強(qiáng)的跨任務(wù)泛化能力。此外,將基礎(chǔ)視覺模型與大語言模型協(xié)同集成,用于增強(qiáng)跨模態(tài)推理,也是下一階段的重要方向。
從更宏觀的角度看,這項(xiàng)工作試圖將 LLM 時(shí)代“預(yù)訓(xùn)練產(chǎn)出通用基座、instruction-tuning 把基座對(duì)齊到具體任務(wù)”的范式引入視覺領(lǐng)域。如果圖像生成能夠成為視覺的通用接口,那么“生成”與“理解”這兩條原本相對(duì)獨(dú)立的研究路線,未來或?qū)R聚到同一個(gè)基礎(chǔ)視覺模型之中。
GPU 訓(xùn)練特惠!
H100/H200 GPU算力按秒計(jì)費(fèi),平均節(jié)省開支30%以上!
掃碼了解詳情?
點(diǎn)「贊」的人都變好看了哦!
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.