VibeVoice 是一個開源的前沿語音 AI 模型家族,包含文字轉語音 (TTS) 和自動語音辨識 (ASR) 模型。
VibeVoice 的一項核心創新是採用連續語音分詞器(聲學和語義),以 7.5 Hz 的超低幀率運行。這些分詞器能有效保留音訊保真度,同時顯著提高處理長序列的計算效率。VibeVoice 採用下一代擴散框架,利用大型語言模型 (LLM) 理解文本上下文和對話流程,並透過擴散頭生成高保真聲學細節。
如需更多資訊、演示和範例,請訪問我們的專案頁面。
VibeVoice-ASR 是一個統一的語音轉文字模型,旨在單次處理長達 60 分鐘的音訊,生成包含誰 (說話者)、何時 (時間戳) 和說了什麼 (內容) 的結構化轉錄稿,並支援自訂熱詞。
🕒 60 分鐘單次處理:與傳統將音訊切成短片段(常會失去全局上下文)的 ASR 模型不同,VibeVoice ASR 在 64K 標記長度內接受長達 60 分鐘的連續音訊輸入。這確保了整個小時的說話者追蹤和語義連貫性。
👤 自訂熱詞:使用者可以提供自訂熱詞(例如,特定名稱、技術術語或背景資訊)來指導識別過程,顯著提高領域特定內容的準確性。
📝 豐富的轉錄 (誰、何時、說了什麼):該模型聯合執行 ASR、語者分段和時間戳標記,產生結構化輸出,指示誰在何時說了什麼。
📖 文件 | 🤗 Hugging Face | 🎮 Playground | 🛠️ Finetuning | 📊 Paper
最適合:長篇對話音訊、播客、多說話者對話
⏱️ 90 分鐘長篇生成:單次合成長達 90 分鐘的對話/單說話者語音,在整個過程中保持說話者一致性和語義連貫性。
👥 多說話者支援:在單一對話中支援多達 4 位不同的說話者,在長對話中實現自然的輪流和說話者一致性。
🎭 富有表現力的語音:生成富有表現力、聽起來自然的語音,捕捉對話動態和情感細微差別。
🌐 多語言支援:支援英語、中文和其他語言。
📖 文件 | 🤗 Hugging Face | 📊 Paper
VibeVoice-Realtime 是一個輕量級的即時文字轉語音模型,支援串流文字輸入和穩健的長篇語音生成。
📖 文件 | 🤗 Hugging Face | 🚀 Colab