![]()
商湯科技發布并全面開源日日新SenseNova-Vision統一視覺大模型,以單模型之力覆蓋檢測、分割、深度估計、3D重建四大核心視覺任務,綜合得分登頂Hugging Face Any-to-Any Leaderboard全球第一。更關鍵的是,它同步開源了5000萬條樣本的視覺語料庫——視覺AI從"模型拼盤"走向"統一生成"的拐點,可能真的來了。
![]()
視覺AI為什么長期擺脫不了"縫合怪"?
檢測要輸出邊界框坐標,分割要輸出像素級掩膜,深度估計要輸出稠密深度圖,3D重建要輸出點云和相機位姿。
不同視覺任務的輸出形式天差地別,導致過去幾十年,視覺領域的研究天然分裂成一個個互不連通的"孤島"。目標檢測、圖像分割、深度預測、3D重建,各自需要獨立的專家模型來完成。
這種"模型拼盤"的架構在面對復雜、充滿干擾的現實場景時,往往力不從心,容易"抓瞎"。
商湯科技最新發布的SenseNova-Vision,試圖用一條完全不同的路線打破這個僵局。
統一生成:把視覺任務全部塞進一個解碼器
SenseNova-Vision的核心思路是把眾多經典視覺任務——檢測、分割、深度、3D重建等,統一表述為多模態生成問題。
![]()
公開資料能確認的是,該模型不再為每個任務設計專屬的模型架構頭、損失函數和解碼規則。圖像輸入后,經過統一的視覺編碼器和文本編碼器,再由統一解碼器輸出。無論是文本形式的結構化描述,還是視覺形式的掩膜、深度圖、法向量、點云,都用同一套生成框架處理。
這意味著模型不再是一個個執行特定指令的機械"工具箱",而是將視覺空間理解能力作為原生本能,內化于大模型體系之中。
![]()
這種架構帶來兩個層面的根本性變革。
數據反哺大模型:視覺領域幾十年積累的海量高質量工業級數據——檢測數據教定位、分割數據教邊界、深度數據教遠近——在統一的生成框架下被大模型完全吸收。
推理賦能視覺任務:大語言模型強大的泛化推理能力反向輸出,讓視覺任務"長出了腦子"。開發者甚至可以用一句自然語言,自主定義一個在訓練中從未被明確列出的新視覺任務。
硬剛全球最強:四大任務,一個模型通吃
SenseNova-Vision在Hugging Face Any-to-Any Leaderboard上綜合得分登頂全球第一。
評測數據顯示,該模型在四大核心視覺任務上,以單模型之力比肩甚至超越了各領域的專用"專家模型"。
與國際領先的同類模型Vision Banana相比,后者的技能點主要集中在兩類任務上,而SenseNova-Vision實現了全任務覆蓋,在多項可比指標上均取得領先。
具體數據層面,公開資料能確認的是:
- 結構化感知:Common Det F1@mIoU 56.6,Dense Det F1@mIoU 66.8
- 稠密幾何:Depth Mean δ? 93.2,Normal Indoor 11.25° 66.9
- 分割:ReaSeg mIoU 62.0,GCGSeg mIoU 66.0
- 多視角3D:Recon F1 Score 87.9,Cam Pose AUC@30 78.7
在與Youtu-VL和Vision Banana的橫向對比中,SenseNova-Vision在檢測mAP、語義分割mIoU、深度估計δ?等核心指標上均表現突出。
零樣本"秒懂"我的世界:四個極端場景撕開代際差
比數據更有說服力的是泛化能力。SenseNova-Vision在多個極端場景下展現出對傳統模型的代際優勢。
![]()
1. 零樣本讀懂《我的世界》
面對訓練集里從未出現過的游戲畫面,模型無需任何微調,就能同步完成表面法向預測、實例分割和目標檢測。影視、游戲創作者可以直接將其投入工作流,無需為每個新場景重新訓練。
2. 超稠密物體"剝離式"分割
在顏色極度相近、邊緣深度交織的密集場景中——比如規整堆疊的鋼管或姿態各異的鋼筋——傳統模型往往難以區分個體。SenseNova-Vision能像外科手術般精準剝離每個獨立個體,為工業計數、智慧倉儲提供高精度"上帝視角"。
3. 免疫"視錯覺"
面對借位攝影等視覺錯覺圖像,傳統模型往往給出錯誤判斷。SenseNova-Vision不僅能準確摳出被遮擋物體的完整輪廓,還能輸出正確的表面法向估計。它不被圖案和借位欺騙,這是語言模型推理能力與稠密幾何預測融合的具象體現。
4. 看穿鏡面反射
在包含鏡子、玻璃的復雜室內環境中,傳統視覺模型極易被鏡中倒影欺騙。SenseNova-Vision能夠自動過濾反射干擾,準確估計鏡中物體的真實空間方向與深度關系,展現了對三維空間幾何本質的深刻理解。
5000萬樣本開源:視覺語料庫的戰略價值
商湯此次同步開放了模型、代碼,以及包含5000萬條樣本的開源視覺語料庫。
![]()
這個語料庫的戰略意義可能不亞于模型本身。
視覺領域長期面臨一個尷尬局面:任務分裂導致數據分裂。檢測數據集、分割數據集、深度數據集各自為政,互不兼容。SenseNova-Vision的統一生成框架,讓異構視覺數據可以在同一套訓練 pipeline 里被"翻譯"成統一的中間表示。
合理推演是:如果這套語料庫和訓練方法被社區廣泛采納,視覺AI的研究范式可能會從"為每個任務攢數據"轉向"為統一模型攢多模態數據"。
這類似于大語言模型時代的預訓練語料革命——當數據規模和多樣性足夠大時,統一模型的涌現能力會超越專用模型的手工設計。
視覺AI并軌AGI主線:一個被重新定位的學科
SenseNova-Vision的哲學意義可能大于技術指標。
計算機視覺曾經處于深度學習研究的中心。但在大模型浪潮中,視覺任務一度被邊緣化為"多模態大模型的一個輸入分支"——模型能看圖說話,但看不懂空間幾何。
SenseNova-Vision展示的是將計算機視覺融入AGI主線的可行性。視覺AI不再是一個個孤島,而是正式并軌,成為通往通用人工智能的主線任務之一。
當模型能用自然語言定義視覺任務、用統一生成框架處理異構輸出、用推理能力免疫視覺錯覺時,"看"與"理解"之間的鴻溝正在被填平。
可信度收束:開源到什么程度?
公開資料能確認的是,商湯已發布模型權重、代碼和5000萬樣本語料庫,模型登頂Hugging Face Any-to-Any Leaderboard。
但關于訓練細節——比如統一解碼器的具體架構、視覺token的表示方式、多任務聯合訓練的損失平衡策略——技術報告中有所涉及,但社區尚未大規模復現驗證。
社區傳聞稱,部分開發者已經在嘗試用該模型處理工業檢測和自動駕駛場景,但還沒有形成系統性的第三方評測報告。
視覺AI的"縫合怪"時代是否真的會終結,取決于統一生成框架在更大規模、更復雜場景下的可擴展性。但至少,SenseNova-Vision提供了一個有力的起點。
結語
商湯用SenseNova-Vision做了一件視覺AI領域期待已久的事:把檢測、分割、深度、3D重建塞進同一個生成框架,讓模型原生學會"看物理世界"。
它登頂Hugging Face全球第一,不只是榜單上的數字游戲。它意味著視覺任務從"專用模型拼盤"向"統一空間理解"邁出了實質性的一步。
5000萬樣本開源語料庫的釋放,更像是在向社區喊話:統一視覺模型的基礎設施已經搭好,接下來看你們怎么往上蓋房子。
視覺AI的GPT時刻會不會來?現在還不好說。但"縫合怪"的縫合線,確實已經開始松動了。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.