視覺語言模型(VLMs)提供了一個令人興奮的可能性,能夠將文字作為渲染影像來處理,從而繞過了將文字標記化為長串標記序列的需求。由於 VLM 的影像編碼器將固定大小的影像映射到固定數量的視覺標記,因此變化的渲染解析度提供了一個精細的壓縮控制旋鈕。然而,隨著壓縮率的增加,準確性會迅速下降:字元縮小到視覺編碼器有效解析度以下,使其無法區分。為了解決這個問題,我們提出了 LensVLM,這是一個推論框架和後訓練方法,讓 VLMs 能夠掃描壓縮影像,然後透過學習到的工具選擇性地將相關影像擴展到其未壓縮的形式。基於 Qwen3.5-9B-Base,LensVLM 在 4.3 倍的有效壓縮率下,能維持與全文本上限相當的準確性,並在七個文本問答基準測試中,在最高 10.1 倍的有效壓縮率下超越了基於檢索、文本和視覺壓縮的基準。LensVLM 也泛化到多模態文件和程式碼理解任務,與基準的準確性增益隨著壓縮率的增加而擴大。我們的分析驗證了這種方法:訓練使視覺壓縮對渲染選擇具有魯棒性,並且隨著壓縮率的增加,模型越來越依賴擴展的內容,而不是不可靠的視覺閱讀。分析還提供了實用的工具選擇指導:對於渲染文本,文本擴展是首選;而對於原生文件,高解析度影像擴展則更適合,因為其佈局線索帶有任務相關的資訊。

LensVLM:透過學習到的工具選擇性擴展壓縮影像中的文字,以維持視覺語言模型的準確性LensVLM:透過學習到的工具選擇性擴展壓縮影像中的文字,以維持視覺語言模型的準確性LensVLM:透過學習到的工具選擇性擴展壓縮影像中的文字,以維持視覺語言模型的準確性LensVLM:透過學習到的工具選擇性擴展壓縮影像中的文字,以維持視覺語言模型的準確性LensVLM:透過學習到的工具選擇性擴展壓縮影像中的文字,以維持視覺語言模型的準確性LensVLM:透過學習到的工具選擇性擴展壓縮影像中的文字,以維持視覺語言模型的準確性