TIPSv2 是 TIPS 系列基礎圖像-文字編碼器的下一代產品,在眾多多模態和視覺任務中展現出強勁的性能。我們的研究始於揭示一個令人驚訝的發現:蒸餾能夠解鎖優於標準預訓練的圖像塊-文字對齊能力,使得蒸餾後的學生模型在該能力上顯著超越其體積大得多的教師模型。我們仔細研究了這種現象,並據此提出了一種改進的預訓練方法,顯著升級了我們的視覺-語言編碼器。我們的預訓練過程引入了三個關鍵的變革(如下圖所示):iBOT++ 將圖像塊級別的自監督損失擴展到所有 token,以實現更強的密集對齊;僅 EMA 投影頭在保留性能的同時降低了訓練成本;多粒度字幕利用 PaliGemma 和 Gemini 的描述來提供更豐富的文字監督。結合這些組件,TIPSv2 在 9 個任務和 20 個數據集上展現出強勁的性能,通常與最新的視覺編碼器模型相當或更好,尤其在零樣本分割方面取得了顯著的進步。
TIPSv2 預訓練概覽。TIPSv2 引入了 3 項預訓練改進:iBOT++(增強的 MIM 損失)、僅 EMA 投影頭(記憶體效率高的自監督損失)和多粒度字幕(更豐富的文字監督)。
TIPSv2 與先前(例如 TIPS 和 SigLIP2)的視覺-語言模型相比,產生了更平滑的特徵圖,並且物體邊界清晰。雖然 DINOv3 也展現了平滑的特徵圖,但 TIPSv2 顯示出更強的語義聚焦:物體邊界被更精確地勾勒出來,並且區域顯示出細粒度的語義細節。我們比較了幾個視覺編碼器的 ViT-g 模型,DINOv3 除外,我們將其與體積大 6 倍的 ViT-7B 進行比較。選擇下方的圖像以探索圖像塊嵌入的 PCA 組件。
TIPSv2 PCA 特徵展示了更細粒度的語義分離:背包、人物和登山杖被清晰地勾勒出來。
上傳您自己的圖像,探索 TIPSv2 的圖像塊嵌入特徵圖,或其在零樣本分割或深度和法線預測中的應用。也可在 HuggingFace 上取得。
TIPSv2 研究了預訓練和蒸餾之間的差異,這促使我們對標準視覺-語言模型引入了三項有針對性的預訓練改進:iBOT++、僅 EMA 投影頭和多粒度文字字幕。
我們揭示了預訓練和蒸餾之間一個令人驚訝的差距:一個從更大的 ViT-g TIPS 教師模型蒸餾出來的較小 ViT-L 模型,在零樣本分割方面的表現遠超其教師模型,這與其他所有評估任務的趨勢相反。我們在 SigLIP2 中也觀察到類似的趨勢。在論文中,我們對預訓練和蒸餾之間的差異進行了消融研究,例如遮罩比例、編碼器初始化、參數凍結或訓練,以及監督。我們的研究表明,導致蒸餾和預訓練之間圖像塊-文字對齊差異的重要區別在於對可見 token 的監督。
蒸餾與標準預訓練:令人驚訝的發現。TIPS ViT-g 預訓練教師模型和從 ViT-g 教師模型蒸餾出的 ViT-L 學生模型的零樣本分割比較。學生模型在圖像塊-文字對齊方面遠超教師模型。
在我們對蒸餾和標準預訓練之間差距的研究中,我們發現監督可見圖像塊是關鍵的區別因素。為了將這種蒸餾的改進引入預訓練,我們提出了一個簡單的增強:iBOT++。標準 iBOT 只監督被遮罩的圖像塊 token,而對可見 token 的表示不加約束,iBOT++ 將圖像塊級別的自蒸餾損失擴展到所有圖像塊(包括被遮罩和可見的),在 ADE150 上的零樣本分割中取得了 +14.1 mIoU 的增益。
iBOT++。將圖像塊級別的損失應用於所有圖像塊(被遮罩和可見),如零樣本分割結果所示,顯著改善了圖像塊-文字對齊。
由於對比損失已經穩定化了視覺編碼器,我們僅將 EMA 應用於投影頭,而不是整個模型。這將訓練參數減少了 42%,同時保留了相當的性能。
僅 EMA 投影頭。在保持性能的同時減少了訓練參數。
我們用更豐富的 Gemini Flash 字幕補充了替代文本和 PaliGemma 字幕,在訓練過程中隨機交替使用它們,以避免在粗略關鍵詞上產生捷徑。這同時提升了密集和全局圖像-文字的性能。
多粒度字幕。不同粒度的圖像字幕。
我們從 TIPS 基線開始,逐一消融每個組件。僅 iBOT++ 就帶來了最大的單一增益:在 ADE150 上的零樣本分割中提高了 +14.1 mIoU(從 3.5 提升到 17.6),證實了將圖像塊級別的損失擴展到可見 token 是密集圖像塊-文字對齊的關鍵驅動因素。
消融研究。從 TIPS 基線開始的累積消融,每個組件在 ViT-g 上添加一個 TIPSv2 組件。
我們在廣泛的評估類別中評估了 TIPSv2,包括密集圖像-文字(零樣本分割)、全局圖像-文字(分類和檢索)以及僅圖像任務(分割、深度、法線、檢索、分類)。選擇下方的標籤以探索詳細結果表。
密集圖像-文字評估。TIPSv2 在所有四個零樣本分割基準測試中均達到 SOTA,其性能優於 SILC 和 DINOv2,儘管後者使用了更複雜的 TCL 評估協議。
全局圖像-文字評估。在 7 項全局評估中的 5 項中,TIPSv2 獲得了最佳或第二佳的成績。值得注意的是,儘管 PE 擁有 56% 更多的參數和 47 倍更多的訓練對,TIPSv2-g 在 5 項共享評估中的 3 項上優於 PE-core G/14。
僅圖像評估。在 9 項僅圖像評估中的 7 項中,TIPSv2 獲得了最佳或第二佳的成績。
DINOv3 與 TIPSv2 比較。我們在兩個系列中最大的通用尺寸 ViT-L 上比較了 TIPSv2 和 DINOv3。儘管 DINOv3 的教師使用了 6 倍的參數和 15 倍的圖像,TIPSv2 在 6 項共享評估中贏得了 4 項,包括零樣本分割(在此情況下兩者都使用了 TCL 的滑動窗口協議)。