Capybara 是一個統一的視覺創作模型,即一個強大的視覺生成與編輯框架,專為高品質視覺合成與操作任務設計。
該框架利用先進的擴散模型和 Transformer 架構,支援多樣化的視覺生成與編輯功能,並能精確控制內容、運動和攝影機移動。
我們建議使用 Anaconda 建立獨立的 Python 環境,並建議使用 CUDA 12.6:
Capybara 需要以下模型組件:
下載所需模型並將它們組織成以下結構:
Capybara 支援兩種推論模式:單一樣本模式(Single Sample Mode),用於單一輸入的快速測試;以及批次模式(Batch Mode),用於透過 CSV 檔案處理多個樣本。兩種模式都支援所有任務類型。
我們在 script/ 下提供了範例腳本,並在 assets/ 下提供了範例資料,以協助您快速上手:
使用文字提示處理單一影像或影片。請參閱 script/test_single_infer.sh 以取得完整範例。
基於指令的影像到影像(Instruction-based Image-to-Image, TI2I):
基於指令的影片到影片(Instruction-based Video-to-Video, TV2V):
使用 CSV 檔案處理多個樣本。請參閱 script/test_infer.sh 以取得完整範例。
對於編輯任務(TI2I / TV2V),請準備一個包含 img_path / video_path 和 instruction 欄位的 CSV 檔案:
path 欄位包含媒體檔案(影像或影片)相對於 data root 目錄的相對路徑。
範例 CSV 檔案可在 assets/test_data/ 中找到。
使用 accelerate 在多個 GPU 上進行分散式推論:
Capybara 為所有任務類型(T2V、T2I、TI2I、TV2V)提供了自訂的 ComfyUI 節點。
範例工作流程可在 comfyui/examples/ 中找到。有關設定細節和節點文件,請參閱 ComfyUI README。
為了獲得最佳品質和效能,我們建議以下設定:
Capybara 支援透過 torchao 對 Transformer 進行 FP8 (E4M3) 權重專用量化。這大約將 Transformer 的權重記憶體減半,允許較大的解析度或較長的影片放入 GPU VRAM。
將 --quantize fp8 加入任何 inference.py 指令:
在 Capybara Load Pipeline 節點中,將 quantize 下拉選單設定為 fp8。該節點會自動處理所有事宜 -- Transformer 將以 FP8 載入 GPU,而其他組件(VAE、文字編碼器等)則像往常一樣卸載到 CPU。