![]()
在多模態(tài)大模型(MLLM)時(shí)代,讓模型看懂一張圖早已不是難事,但要讓它真正想清楚一張圖,做多步的空間感知、幾何分析與邏輯推斷,卻依然存在困難。
為了解決這種「看得到卻想不對(duì)」的現(xiàn)象,研究界給推理鏈里塞進(jìn)了視覺(jué)信息:一種是顯式生成中間圖像(如 Anole、ThinkMorph),效果理想,但算力開(kāi)銷(xiāo)高;另一種是隱式隱空間推理(如 Mirage、LVR),試圖直接在特征空間里「一步」定位出目標(biāo)區(qū)域,結(jié)果常常精度崩塌、注意力關(guān)注在無(wú)關(guān)的背景上。
針對(duì)這一挑戰(zhàn),騰訊內(nèi)容服務(wù)部 BAC 提出了一個(gè)名為ProLaViT(Progressive Latent Visual Thought)的全新框架。它的核心思想是:別急著下結(jié)論,先在連續(xù)隱空間里像人一樣「步步推導(dǎo)」。 即讓模型遵循「定位 → 聚焦 → 分離」(Locate → Focus → Isolate)的因果鏈,逐步收緊視覺(jué)注意力,最終精準(zhǔn)鎖定目標(biāo)。
該論文已被 ECCV 2026 接收。
![]()
- 論文地址:https://arxiv.org/abs/2607.02907
- Github 地址:https://github.com/TencentBAC/ProLaViT
- 項(xiàng)目主頁(yè):https://tencentbac.github.io/ProLaViT/
- Huggingface 地址:https://huggingface.co/collections/TencentBAC/prolavit
現(xiàn)有路線的問(wèn)題:
顯式生成太貴、隱式推理太飄
如下圖所示,把視覺(jué)信息引入推理鏈的現(xiàn)有路線各有硬傷:
1. 純文本 CoT:模態(tài)鴻溝。 讓模型把推理一步步寫(xiě)成文字。問(wèn)題在于,文本本質(zhì)上是抽象的,天然丟失細(xì)粒度的空間關(guān)系。于是模型把「電視下方的家具」腦補(bǔ)成了「木地板」,邏輯通順,結(jié)果卻是錯(cuò)的。
2. 一步隱空間預(yù)測(cè):精度崩塌。 想跳過(guò)文本,直接在隱空間里一次性指出目標(biāo)區(qū)域。但單步預(yù)測(cè)往往超出了模型的表征容量,結(jié)果就是注意力跑偏,脆弱的表征最終導(dǎo)致錯(cuò)誤答案。
ProLaViT 的答卷很干脆:既不畫(huà)像素,也不瞎猜,而是在「結(jié)構(gòu)化隱空間」里做漸進(jìn)式推導(dǎo)。 把一道復(fù)雜的視覺(jué)題拆成一條隱式思維鏈,讓每一步只往前走一小步。
![]()
不請(qǐng)「外援」:
模型自己的眼睛,就是最好的老師
訓(xùn)練多步隱空間模型有個(gè)繞不開(kāi)的難題:中間步驟沒(méi)有現(xiàn)成的「標(biāo)準(zhǔn)答案」圖像。 以往的方法只能去請(qǐng)外援,例如 SAM、DINO、DepthAnything 這些外部視覺(jué)專(zhuān)家來(lái)當(dāng)老師。然而,這樣做往往帶來(lái)域偏移和工程復(fù)雜度的問(wèn)題。
ProLaViT 的做法是:內(nèi)生自蒸餾(Endogenous Self-Distillation)。 不請(qǐng)外人,直接拿 MLLM 預(yù)訓(xùn)練視覺(jué)編碼器當(dāng)老師。
![]()
上述方案具體怎么做?關(guān)鍵在于一條可編程合成流水線(Programmatic Synthesis Pipeline)
![]()
![]()
- 再用一次跨模態(tài)注意力,把 LLM 生成的隱式思維對(duì)齊到教師特征上,最小化蒸餾損失:
![]()
這么一來(lái),模型在訓(xùn)練時(shí)就把漸進(jìn)式視覺(jué)證據(jù)內(nèi)化進(jìn)了自己的隱空間,推理時(shí)完全不需要任何外部工具。
兩套「思維套路」:
空間題靠定位,邏輯題靠思辨
ProLaViT 把推理拆成一條隱式思維鏈,并針對(duì)不同任務(wù)設(shè)計(jì)了兩種范式。
![]()
套路一:由粗到細(xì)因果鏈(Coarse-to-Fine Causal Chain)。 面向視覺(jué)搜索、目標(biāo)定位等空間任務(wù),走 「定位 → 聚焦 → 分離」 的路子,注意力一步步聚焦:
![]()
套路二:辯證推理鏈(Dialectical Reasoning Chain)。 面向拼圖復(fù)原這類(lèi)邏輯任務(wù),走 「假設(shè) → 批判 → 驗(yàn)證」(Hypothesize → Critique → Verify) 的反事實(shí)思辨路線:
![]()
每一步都由 LLM 嵌入空間里的一組可學(xué)習(xí) token 表示。
防止「思路打結(jié)」:
距離加權(quán)多樣性損失
多步隱空間推理有個(gè)常見(jiàn)問(wèn)題,即隱空間坍縮(Latent Collapse):后續(xù)步驟的表征越來(lái)越相似,隱式思維鏈發(fā)生退化。
作者借鑒度量學(xué)習(xí),提出距離加權(quán)多樣性損失(Distance-Weighted Diversity Loss)。先用一個(gè)帶間隔的形式,允許隱式思維鏈的 hidden state 合理相似、只懲罰過(guò)度坍縮:
![]()
除此之外,更關(guān)鍵的洞見(jiàn)是:因果距離越遠(yuǎn)的兩步,越應(yīng)該彼此不同。 于是給每對(duì)步驟加上一個(gè)距離權(quán)重:
![]()
![]()
這樣既尊重了推理鏈的層級(jí)結(jié)構(gòu),相鄰步保留適度相似以延續(xù)語(yǔ)境,遠(yuǎn)端步被強(qiáng)制拉開(kāi),又有效防住了表征坍縮。
![]()
跑分見(jiàn)真章:
準(zhǔn)、穩(wěn),還看得見(jiàn)「想法」
作者基于 Qwen2.5-VL-7B-Instruct 實(shí)現(xiàn) ProLaViT,在 MMVP、VisPuzzle、VStar、ChartQA、BLINK、CV-Bench 等一系列的視覺(jué)推理基準(zhǔn)上做了廣泛測(cè)試。
![]()
1. 準(zhǔn)。 ProLaViT(完整版,帶距離加權(quán)多樣性損失)拿下了75.11% 的最高平均準(zhǔn)確率,全面超越基線。相比「一步隱空間預(yù)測(cè)」,在 VisPuzzle(+2.25%)和 BLINK-Jigsaw(+10.00%)這類(lèi)復(fù)雜任務(wù)上提升尤為顯著。
2. 穩(wěn)。 ProLaViT 靠?jī)?nèi)生自蒸餾保持域一致性,在 ChartQA 上穩(wěn)穩(wěn)拿下78.99%。在最考驗(yàn)邏輯驗(yàn)證的 BLINK-Jigsaw 上,更是相比基座模型暴漲 +16.67%,驗(yàn)證了「假設(shè) → 批判 → 驗(yàn)證」辯證范式的有效性。
3. 可解釋。 作者把各推理步 token 表征的余弦相似度畫(huà)成熱力圖:
![]()
![]()
消融實(shí)驗(yàn)
漸進(jìn)式分解不可或缺。 把所有視覺(jué)線索壓進(jìn)單個(gè)隱狀態(tài)的「一步預(yù)測(cè)」存在明顯瓶頸;換成 ProLaViT 的多步推導(dǎo)后,ChartQA +15.97%、BLINK-Jigsaw +10.00%,平均 +7.45%。復(fù)雜視覺(jué)推理確實(shí)會(huì)壓垮單一隱狀態(tài),而結(jié)構(gòu)化鏈能把認(rèn)知負(fù)擔(dān)分?jǐn)傞_(kāi)。
![]()
內(nèi)生 vs. 外生蒸餾。 把原生視覺(jué)編碼器換成外部專(zhuān)家:DINOv2(判別式)尚能打,但在 VStar 等細(xì)粒度感知上落后;SDXL-VAE(生成式)在 VisPuzzle 上災(zāi)難性失敗。作者推測(cè)原因是 VAE 隱空間為像素重建而生,幾何與空間邏輯被壓成了噪聲。原生編碼器提供的才是天然對(duì)齊的監(jiān)督信號(hào)。
![]()
推理步順序至關(guān)重要。 把四步順序隨機(jī)打亂后,平均 下降 6.24%,VisPuzzle(-6.25%)和 CV-Bench(-8.52%)。沒(méi)先建立全局上下文就直接做細(xì)粒度分割,違背了信息的自然流向,即漸進(jìn)式因果結(jié)構(gòu)是有效視覺(jué)推理的根本前提。
![]()
展望
ProLaViT 提出了一種「結(jié)構(gòu)化隱空間漸進(jìn)推導(dǎo)」的視覺(jué)推理新范式。它打破了「顯式生成太貴、隱式推理太飄」的兩難,用內(nèi)生自蒸餾讓模型從可編程合成數(shù)據(jù)中內(nèi)化算法級(jí)精度、擺脫對(duì)外部視覺(jué)專(zhuān)家的依賴(lài),再用距離加權(quán)多樣性損失緩解隱空間坍縮,讓每一步思維都獨(dú)特而遞進(jìn)。
這項(xiàng)工作不僅在視覺(jué)搜索、拼圖復(fù)原等重感知基準(zhǔn)上取得了有競(jìng)爭(zhēng)力的結(jié)果,更重要的是,它把推理從離散的文本空間搬進(jìn)了連續(xù)的結(jié)構(gòu)化隱空間,為彌合困擾傳統(tǒng)思維鏈的模態(tài)鴻溝提供了一條兼顧準(zhǔn)確率、可解釋性與效率的可行路徑。面向未來(lái),把這種結(jié)構(gòu)化隱式推導(dǎo)拓展到視頻時(shí)序推理、引入更復(fù)雜的幾何變換,將為更通用、更可解釋的多模態(tài)智能鋪平道路。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.