我們介紹 Helios,這是首款 140 億參數的影片生成模型,能在單一 NVIDIA H100 GPU 上以每秒 19.5 幀的速度運行,並支援生成長達數分鐘的影片,同時保持與強大基準模型相當的影像品質。我們在三個關鍵維度上取得了突破:(1) 無需常用的防漂移啟發式方法,如自我強制、錯誤銀行或關鍵影格取樣,即可對長影片漂移具有穩健性;(2) 無需標準加速技術,如 KV 快取、稀疏/線性注意力或量化,即可實現即時生成;(3) 無需平行化或分片框架即可進行訓練,實現了與圖像擴散模型相當的批次大小,同時將最多四個 140 億參數模型放入 80 GB 的 GPU 記憶體中。

具體來說,Helios 是一個 140 億參數的自迴歸擴散模型,具有統一的輸入表示,原生支援 T2V、I2V 和 V2V 任務。為了減輕長影片生成中的漂移問題,我們對典型的失敗模式進行了特徵分析,並提出了簡單而有效的訓練策略,在訓練過程中明確模擬漂移,同時從源頭上消除重複運動。

為了提高效率,我們對歷史和嘈雜的上下文進行了大量壓縮,並減少了取樣步驟的數量,從而產生了與 13 億參數影片生成模型相當甚至更低的計算成本。此外,我們引入了基礎設施級的優化,加速了推理和訓練,同時減少了記憶體消耗。

廣泛的實驗表明,Helios 在短影片和長影片生成方面始終優於先前的方法。我們計劃發布程式碼、基礎模型和蒸餾模型,以支持社群的進一步發展。