視覺語言模型(VLMs)提供了一個令人興奮的可能性,能夠將文字作為渲染影像來處理,從而繞過了將文字標記化為長串標記序列的需求。由於 VLM 的影像編碼器將固定大小的影像映射到固定數量的視覺標記,因此變化的渲染解析度提供了一個精細的壓縮控制旋鈕。然而,隨著壓縮率的增加,準確性會迅速下降:字元縮小到視覺編碼器有效解析度以下,使其無法區分。為了解決這個問題,我們提出了 LensVLM,這是一個推論框架和後訓練方法,讓 VLMs 能夠掃描壓縮影像,然後透過學習到的工具選擇性地將相關影像擴展到其未壓縮的形式。基於 Qwen3.5-9B-Base,LensVLM 在 4.3 倍的有效壓縮率下,能維持與全文本上限相當的準確性,並在七個文本問答基準測試中,在最高 10.1 倍的有效壓縮率下超越了基於檢索、文本和視覺壓縮的基準。LensVLM 也泛化到多模態文件和程式碼理解任務,與基準的準確性增益隨著壓縮率的增加而擴大。我們的分析驗證了這種方法:訓練使視覺壓縮對渲染選擇具有魯棒性,並且隨著壓縮率的增加,模型越來越依賴擴展的內容,而不是不可靠的視覺閱讀。分析還提供了實用的工具選擇指導:對於渲染文本,文本擴展是首選;而對於原生文件,高解析度影像擴展則更適合,因為其佈局線索帶有任務相關的資訊。
LensVLM:透過學習到的工具選擇性擴展壓縮影像中的文字,以維持視覺語言模型的準確性
視覺語言模型(VLMs)能將文字渲染成影像處理,但壓縮會降低準確性。LensVLM 提出一種推論框架與後訓練方法,讓 VLM 能掃描壓縮影像,並透過學習到的工具選擇性地將相關部分擴展至未壓縮狀態。此方法在 4.3 倍壓縮下能維持與全文本相當的準確性,並在更高壓縮倍率下超越現有基準。LensVLM 也適用於多模態文件和程式碼理解任務,且隨著壓縮率增加,其準確性優勢也隨之擴大。
本文為 AI 輔助中文翻譯與整理,內容依據原文來源: Hacker News