大數據文摘受權轉載自學術頭條
作者:夏千斯
2012 年,AlexNet 在 ImageNet 競賽中大幅領先,正式開啟深度學習時代。此后十多年,ImageNet 一直是視覺研究最重要的公共基準之一。
如今,這把“尺子”已難衡量視覺生成研究。比起分類或生成效果指標,文生圖更缺的是一套公開、穩定、可復現的訓練數據基準。Sora、Stable Diffusion 等模型不斷進步,但訓練數據仍是黑箱:LAION-5B 鏈接易失效,YFCC100M 許可邊界不清,DataComp 雖然更開放,但通常仍需研究者自行抓取數據。
針對這個問題,由李飛飛領導的斯坦福大學研究團隊提出了 GPIC(Giant Permissive Image Corpus), 收錄約 1 億對圖文,總計近 28 萬億像素,試圖為視覺生成研究提供一套更透明、可復現的公共基準。
GPIC 旨在同時滿足寬許可、穩定、大規模和易獲取四項屬性。研究團隊公開了其構建方法、發布格式、評測協議和參考基線,數據集也已全量托管在 Hugging Face 上,可供免費下載使用。
![]()
論文鏈接:https://arxiv.org/abs/2605.30341
GPIC 是如何設計的?
GPIC 是一個面向視覺生成的大規模寬許可圖像數據集,其構建流程包括數據源篩選、圖像過濾、去重和字幕生成。最終,GPIC 被整理為約 12.9TB、8000 個分片,并提供 100 萬、1000 萬和 1 億樣本三個嵌套規模,分別對應 GPIC-Nano、GPIC-Lite 和 GPIC-Full,可直接流式傳輸,用于大規模分布式訓練。
![]()
圖|數據集構建流程
數據源篩選:研究團隊僅從 Flickr 和 Wikimedia 兩個平臺收集圖片,并嚴格限定在 CC BY、CC0、公有領域和無已知限制這四類授權范圍內。研究初始收集到的圖片約 1.11 億張,公開元數據包括來源標識、分辨率、檢索時間戳、許可證及歸因信息,但不包含原始 URL。GPIC 整體以 MIT 協議發布,單張圖像仍遵循原始許可和署名要求。
圖像過濾:研究團隊先去掉尺寸太小、長寬比異常,或最長邊不到 256 像素的圖像,再用視覺語言模型Qwen3-VL-4B-Instruct 去除近白、近黑、嚴重模糊、過曝和欠曝等低質量圖像,并篩除潛在不安全內容。
![]()
圖|因分辨率過低和視覺質量較差而被過濾掉的示例圖像。
去重:研究團隊先用 SSCD 提取圖片特征,再結合 FAISS 找出可能重復的圖片。在此基礎上,研究團隊根據圖片相似度和重復簇大小設定去重規則,僅保留每組中分辨率最高的一張。最終共保留約 1.013 億張圖片,并通過 SHA-256 確認其中不存在完全相同的重復文件。
![]()
圖|不同 SSCD 相似度區間下相似圖像對的定性示例。
字幕生成:傳統圖片數據集的文字描述質量普遍較差,充斥著“photo.jpg”“未命名”等無意義標注。該數據集將字幕分為標簽、短描述、中等描述和長描述四類,其中短描述和中等描述分別占 45%,長描述占 9%,標簽占 1%。研究團隊基于 1520 張圖像的人工核驗集對多種方案進行比較后,最終選擇 Qwen3-VL-4B-Instruct,處理 1 億張圖像約需 1500 個 H100 GPU 小時。
![]()
圖|字幕生成模型選擇。
視覺生成基準評估
為了讓不同模型在 GPIC 上的結果具備可比性,研究團隊給出了統一的評測指標,也明確標注了哪些做法可能影響結果,并提供了一個可供對照的參考基線。
評測指標
評測時,研究團隊需用固定的 5 萬條測試字幕生成圖像,并與 GPIC 測試集預先計算好的統計量進行比較。這些統計量來自獨立測試集,而非訓練集。主指標是 FD-DINOv2,即基于 DINOv2 特征計算的 Fréchet Distance;此外還報告精確率、召回率、密度和覆蓋率。研究團隊還提供了多個 GPIC 子集相對于 Test-1M 的真實數據參考值,供結果對照。
![]()
圖|基于 DINOv2 特征、以 100 萬張 GPIC 測試集為參照評估各個 GPIC 子集得到的 Oracle參考指標
評測邊界
不過,研究團隊也特別強調,這一基準并不只是“看分數”這么簡單。為了避免模型專門針對評測空間進行定向優化,如果訓練過程中直接使用 DINOv2 特征、FD-DINOv2 相關損失,或其他專門對齊該評測空間的目標,相關結果都需要單獨披露,不納入標準 GPIC 對比。是否改寫評測字幕、是否更換相關模型,以及是否使用更大的輔助模型,也需要在結果中明確說明。
參考基線
在明確評測方式和對比邊界之后,研究團隊還提供了一個可操作的參考基線,方便后續工作橫向比較。具體來說,他們在 GPIC-Full 上訓練 JiT-T2I,采用 PixGen-XXL/16,并使用 Qwen3-1.7B 作為文本編碼器。該模型在 8 張 H100 上訓練 1 個 epoch,耗時約 40 小時;在 CFG=6.25 時取得最佳結果,FD-DINOv2 為 76.25。
![]()
圖|JiT-T2I 在 GPIC-Full 上訓練 1 個 epoch 后的生成樣本。
不足和未來方向
目前,GPIC 仍然面臨大規模圖像語料常見的社會風險,包括模型對訓練內容的記憶、平臺偏差放大,以及被用于有害生成的潛在風險。研究團隊指出,雖然 GPIC 采用凍結 tar 分片形式發布,有助于降低僅依賴 URL 索引分發所帶來的鏈接失效、數據漂移與復現不穩定問題,但殘余近重復樣本仍難以被徹底消除。未來,如果要進一步提升這類數據集的穩定性與可控性,仍需要持續加強去重、發布審計,并進一步處理偏差與安全風險問題。
與此同時,GPIC 所依賴的合成字幕本身也存在一定誤差。盡管這些字幕顯著提升了圖像語義信息的可用性,但在計數、空間關系和細粒度 OCR 等維度上仍會出現偏差,因此還不能等同于高精度人工標注。研究團隊也提示,仍需進一步評估這些誤差在全庫中的整體分布,以及它們對下游生成模型訓練的實際影響。未來,若要繼續提升 GPIC 的數據質量,既需要圍繞易錯類型開展更細粒度的誤差分析,并結合更大規模的人工抽檢與定向糾錯,也需要建立更完整的數據審計、質量評測和安全評估框架。
更多技術細節,詳見原論文。
點「贊」的人都變好看了哦!
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.