我們推出 LAION-BVD(LAION 大型影片資料集),這是一個用於多模態學習的大規模開放影片資料集,包含從 CommonCrawl 收集的13億個平台特定影片網址。從中下載了8000萬支影片,總時長達1000萬小時。該資料集設計用於跨影片、音訊與影像多模態的預訓練。
透過內容感知的場景偵測,我們擷取片段並合成生成影片與音訊的字幕。使用這些資料訓練的模型,在標準的影片-文字與音訊-文字基準測試中達到具競爭力的表現,且隨著訓練規模或模型規模增加,表現持續提升。此外,我們探索將影片畫面作為影像-文字資料的替代來源,透過擷取場景變換的畫面。這些畫面展現出與標準網路影像資料庫不同的視覺分布,使用該資料集訓練的模型在影像-文字檢索任務中表現優異。
我們將 LAION-BVD 釋出給研究社群,顯著擴大了多模態影片的開放存取規模,達到前所未有的程度。
這是目前最大規模的開放多模態學習影片資料庫,包含從 Common Crawl 收集的平台特定網址,成功下載並處理的影片數量龐大,整合所有下載影片的內容,並提供影片畫面用於影像-文字預訓練。
在 LAION-BVD 上訓練的模型,在影片、音訊與影像-文字基準測試中均展現出競爭力。以 ViCLIP 模型為例,訓練於 LAION-BVD 的模型在標準影片-文字基準測試中,表現可與 InternVid 訓練的模型匹敵甚至提升2.1%,且隨著訓練規模從1000萬片段增加到5000萬片段,表現持續改善。
CLAP 模型利用 LAION-BVD 訓練,能在其他大型未經篩選的音訊資料集上達到競爭性表現,因為它直接從影片中擷取豐富的自然音景。
基於畫面的 CLIP 模型在標準影像-文字檢索基準中表現強勁。影片畫面展現出與典型網路資料庫不同的視覺分布,能補充現有的影像預訓練來源。
LAION-BVD 的釋出旨在支持大規模多模態研究的開放與可重現性。大型影片資料集及其訓練模型日益集中於少數主要的專有科技公司,限制了獨立科學研究與可重現性。透過提供學術研究的開放資源,我們希望擴大多模態訓練資料的可及性,並促進大型影片、音訊與影像模型的透明評估。
與其他大型網路資料集類似,LAION-BVD 可能包含偏見、刻板印象,以及在語言、地區和主題上的不均衡代表性。使用該資料集訓練的模型可能繼承這些偏見。研究人員應意識到這些限制,並在相關情況下評估與報告這些偏見,與模型能力一併呈現。