允中 發自 凹非寺
量子位 | 公眾號 QbitAI
隨著視覺語言模型分辨率與圖文理解能力持續升級,圖像會被編碼為數百至上萬個視覺Token。
大量Token持續參與解碼計算、長期占用KV Cache,帶來顯存開銷大、推理速度慢、部署成本高等一系列問題,視覺Token冗余已成為多模態模型高效推理與規模化落地的核心瓶頸。
當前行業通用方案為傳統Top?K Token篩選:對每個Token獨立打分,僅保留得分最高的部分樣本。
但該方法存在明顯缺陷:高分Token高度集中在畫面顯著區域,反復保留同質化冗余信息,極易遺漏文字、數字、坐標軸、目標空間關系等分散但關鍵的互補證據;
同時低分Token被直接刪除,攜帶細節信息永久丟失,導致模型推理失真、事實判斷偏差、視覺幻覺增多,普遍存在「壓縮必掉精度」的行業難題。
![]()
△傳統Top-K Token篩選方法與GMC的對比
針對以上痛點,中國科學院自動化研究所紫東太初大模型團隊,提出核心集剪枝方法GMC(Grounded Message Coreset Pruning),實現了技術跨越式創新。
![]()
GMC徹底跳出「篩選單個最優Token」的傳統思路,基于模型真實推理邏輯,認為視覺語言模型依賴的是全體Token構成的集體消息,而非孤立圖像塊。因此壓縮不僅要確定「信息保留位置」,更要解決「保留Token的信息承載方式」。
![]()
△核心集剪枝方法GMC整體框架
核心創新:雙階段架構,從根源化解Token冗余與信息丟失矛盾
GMC整體分為互補證據自適應篩選群體互補信息傳輸兩大核心階段,在不訓練、無額外模型依賴的前提下,實現高保真、高效率的視覺序列壓縮。
1. 互補證據自適應篩選
GMC同時從問題語義、視覺外觀和空間位置三個角度構建證據。
首先,利用視覺語言模型內部原生的視覺-文本注意力,識別與當前問題直接相關的區域;
其次,根據視覺特征之間的相似性保護圖像中的不同外觀結構,避免模型只關注當前已經被問題激活的內容;
最后,通過原始圖像坐標構建空間證據,保留圖表、文檔以及關系推理任務中重要的位置和幾何信息。
在選擇關鍵性Token時,GMC根據其對“尚未覆蓋證據”的新增貢獻進行選擇。
當某一區域已經得到充分表示后,附近相似Token的價值會隨之降低,系統會轉而選擇能夠補充文字、目標、數字或空間關系的其他區域。
由此,有限的Token預算可以被分配給多種互補信息,而不是反復集中在同一顯著位置。
2. 群體互補信息傳輸
僅僅選出具有代表性的位置并不能完全解決信息丟失問題,因為未被選中的Token仍然攜帶著細節信息。
GMC因此進一步提出Population Transport群體互補信息傳輸機制,將所有待刪除Token的隱藏狀態傳輸到最合適的代表Token中。
該過程綜合考慮視覺特征相似性和空間鄰近關系,將大量視覺Token聚合為少量緊湊表示。
語義匹配清晰的內容可以被傳輸到相似代表,而容易混淆的局部細節則更傾向于保留在附近位置。
聚合完成后,未選中的視覺Token被刪除,模型隨后在壓縮后的Token序列上繼續執行注意力計算。
與需要重新訓練模型或引入外部工具的方法不同,GMC不需要任務標簽、參數更新、輔助檢測器、OCR模型或額外模型,可以直接應用于已有視覺語言多模態大模型中。
同時,GMC實現的是真實序列壓縮,而不是簡單地通過掩碼隱藏Token,因此能夠實際減少后續解碼層計算和KV Cache占用。
方案核心優勢:零成本適配各類圖文大模型
1、全程免訓練,無額外依賴
無需模型微調、任務標簽、外部OCR / 檢測器、輔助模型,開箱即用,直接兼容Qwen、LLaVA等主流視覺語言大模型;
2、壓縮不降質,自帶去噪增益
過濾無效冗余Token的同時完整留存推理所需視覺證據,多項基準測試中性能持平甚至優于原始完整模型;
3、抑制視覺幻覺,事實一致性更強
在POPE、HallusionBench等幻覺評測集表現突出,大幅減少壓縮后模型錯描述、信息缺失問題;
4、跨模型通用,全場景適配
可遷移至不同架構7B級多模態模型,覆蓋通用圖文問答、圖表解析、長文檔識別全業務場景。
權威實驗結果:超高壓縮率,完美解決Token冗余痛點
團隊基于TextVQA、ChartQA、MME、POPE、MMBench、GQA等多項主流視覺理解基準,在Qwen2.5-VL-7B-Instruct、LLaVA-1.5-7B模型上完成全量驗證。
![]()
△GMC在Qwen2.5-VL-7B和LLaVA-1.5-7B上的性能與效率表現
1、在Qwen2.5-VL-7B上,完整模型包含1296個視覺Token。
當視覺Token數量減少80.2%、僅保留256個時,GMC-H2保留了完整模型97.78%的平均能力,當進一步減少90.1%、僅保留128個視覺Token時,GMC-L16仍保持99.11%的平均能力。
2、在LLaVA-1.5-7B上,GMC-L16在分別保留128個和64個視覺Token時,平均性能達到完整模型的99.76%和99.82%,表明該方法能夠遷移到不同視覺語言模型架構。
GMC方法性能與基線模型性能一致甚至略高于基線模型,表明GMC不僅可以減少計算量,甚至可以通過移除無關信息達到去噪效果,進而能夠輕微提升模型的多模態理解能力。
除了常規視覺問答能力,研究團隊還在POPE、AMBER、HallusionBench和CHAIR等基準上評估了模型的視覺幻覺。
實驗結果表明,在相同Token預算下,GMC能夠更加完整地保留事實判斷所需的視覺證據,在顯著壓縮視覺序列的同時減少錯誤描述和信息遺漏。結果如下表所示:
![]()
△在相同視覺Token預算下,GMC在多類視覺幻覺評測中保持更好的事
在長文檔問答場景中,面對包含15876個原始視覺Token的輸入,GMC在保持完整模型98.87%問答質量的情況下,實現了1.258倍端到端推理加速,并減少73.94%的提示KV Cache,驗證了該方法在實際部署中的效率優勢。
隨著多模態大模型向高分辨率、長上下文、復雜真實場景演進,Token冗余帶來的算力、顯存成本問題,已經成為產業規模化落地的核心阻礙。
紫東太初GMC不僅是一款全新的核心集剪枝方法,更提供高效、可信的多模態部署新范式:
視覺壓縮的核心不是減少Token數量,而是以更低的計算代價,完整支撐模型精準推理所需的全局視覺信息
未來紫東太初大模型團隊將持續迭代GMC技術體系,適配更多大模型架構與復雜業務場景,持續破解多模態模型「算力成本與推理精度」的核心矛盾,推動國產多模態大模型高效、低成本、規模化落地。
論文地址:https://arxiv.org/abs/2608.02134v1
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.