今天我們發布了 Bonsai Image 4B,這是一系列精巧的圖像生成模型,專為在本地硬體上運行高品質的擴散推理而設計:從筆記型電腦到手機。

Bonsai Image 4B 包含兩個變體:

這帶來了圖像生成的新部署模式:具備強大輸出能力、開放權重,以及在先前此類模型難以觸及的裝置上進行實際的本地推理。據我們所知,Bonsai Image 4B 是其參數類別中第一個可以直接在 iPhone 上運行的圖像模型。

本地圖像生成始於一個嚴格的限制:模型必須符合裝置的記憶體預算。

對於一個 4B 級別的圖像模型,擴散轉換器是模型中最大的一部分,也是生成過程中重複運行的部分。每次去噪步驟都會再次調用轉換器,因此轉換器的大小直接影響記憶體壓力、頻寬需求和本地推理速度。

Bonsai Image 4B 是基於 FLUX.2 Klein 4B 建構的。它保持了架構的完整性,但改變了轉換器權重的表示方式。透過將這些權重轉換為二進位和三元形式,Bonsai 減輕了對本地部署最重要的圖像管線部分。

二進位層相較於全精度轉換器權重,提供了約 14 倍的縮減。一小部分對精度敏感的支援張量(約 5%),稱為投影層,仍保留為 FP16,因此最終的 1 位元 Bonsai Image 4B 轉換器為 0.93 GB:相較於 7.75 GB 的全精度 FLUX.2 Klein 4B,縮減了 8.3 倍。

三元變體遵循相同的結構。其三元層提供了約 10 倍的縮減,最終的三元 Bonsai Image 4B 轉換器為 1.21 GB,相較於全精度轉換器縮減了 6.4 倍。它比 1 位元模型稍大,但額外的零狀態提高了視覺品質和提示的準確性。

包含壓縮的文字編碼器和 FP16 VAE,對於 1 位元 Bonsai Image 4B,Apple Silicon 的部署載荷為 3.42 GB,對於三元 Bonsai Image 4B 為 3.88 GB。作為比較,全精度 FLUX.2 Klein 4B 需要 15.97 GB 的部署載荷。由於在運行時,文字編碼器在提示編碼後會被卸載,因此平均記憶體使用量小於總載荷。生成 512x512 圖像時,二進位和三元模型的平均活躍記憶體分別為 1.5 GB 和 1.96 GB,而原始 FLUX.2 Klein 4B 為 11.74 GB(分別縮減了 7.8 倍和 6.0 倍)。生成 1024x1024 圖像時,二進位和三元模型的平均活躍記憶體分別為 1.95 GB 和 2.38 GB,而原始 FLUX.2 Klein 4B 為 14.39 GB(分別縮減了 7.4 倍和 6.0 倍)。

記憶體佔用的減少改變了模型的運行地點。我們的部署堆疊支援 Apple Silicon iPhone、iPad 和 Mac,以及 CUDA GPU,在 Apple 硬體上使用 MLX 低位元路徑,在 CUDA 上使用 Gemlite 低位元 GEMM 核心。在 iPhone 17 Pro Max 上,全精度 FLUX.2 Klein 4B 管線無法符合裝置記憶體預算,而 Bonsai Image 的兩個變體都能在裝置上運行。

實際上,Bonsai Image 4B 在 iPhone 17 Pro Max 上生成 512x512 圖像需要 9.4 秒,在 Mac M4 Pro 上約需 6 秒。在 Mac M4 Pro 上,Bonsai Image 4B 的速度比標準全精度 MFLUX 管線快 5.6 倍。

壓縮只有在模型仍然有用時才有意義。我們在三個互補的基準測試中評估了 Bonsai Image 4B:GenEval 用於物件組合和屬性綁定;HPSv3 用於人類偏好和美學品質;DPG-Bench 用於密集提示遵循和語義保真度。

三元 Bonsai Image 4B 是注重品質的變體。在 1.21 GB 的大小下,它在 GenEval、HPSv3 和 DPG-Bench 上保留了 FLUX.2 Klein 4B 準確度的 95%,同時將擴散轉換器的佔用空間縮減了 6.4 倍。

1 位元 Bonsai Image 4B 是注重佔用空間的變體。它將擴散轉換器的大小縮減到 1 GB 以下,縮減了 8.3 倍,同時在相同的三個評估中仍能提供強勁的基準分數(它保留了 FLUX.2 Klein 4B 準確度的 88%)。

總之,這兩個變體推動了品質與佔用空間的邊界。Bonsai Image 在使用現代 4B 級別圖像模型一小部分的擴散轉換器佔用空間的同時,保持了競爭力。同時,它大幅超越了具有相似記憶體佔用空間的較小模型。這與我們先前在 Bonsai 語言模型中看到的帕累托前移現象相同。Bonsai Image 將現代擴散轉換器行為帶入了先前屬於小得多、能力較弱模型的記憶體範圍。

圖像生成不僅是模型品質問題。它也是部署問題。

雲端 API 將繼續是許多產品的正確選擇。但僅限雲端的生成會帶來某些產品限制:每個提示都是遠端請求,每次迭代都會產生邊際服務成本,每次互動都會增加往返延遲。

這很重要,因為圖像生成本質上是迭代的。使用者很少只停留在一個圖像上。他們會修改提示、比較輸出、生成變體、捨棄失敗並重試。當每次嘗試都是伺服器端工作時,創意循環就變成了使用者必須計量和等待的東西。本地推理改變了這一點。一旦模型適合裝置,生成就可以直接嵌入產品體驗中。運行成本更低,迭代速度更快,並且在提示和生成的資產應保持私密的環境中更容易使用。

Bonsai Image 4B 是朝向該部署模式邁出的一步:讓強大的圖像生成能力更貼近使用者,運行在其已擁有的硬體上。

1 位元和三元 Bonsai Image 4B 都將以 Apache 2.0 授權下的開放權重和程式碼發布。隨著這次發布,我們也將推出 Bonsai Studio,這是一款用於直接在 iPhone 上試用 Bonsai Image 4B 的 iOS 應用程式。

PrismML 源自一群加州理工學院的研究人員,並在 Khosla Ventures、Cerberus 和 Google 的支持下成立。我們花費了數年時間解決該領域最棘手的問題之一:在不犧牲推理能力的情況下壓縮神經網路。

如果您想幫助建構下一代最先進的人工智慧,我們很樂意聽取您的意見。請查看我們的職涯頁面。