語音 AI 的未來,取決於其是否能聽起來自然、快速、富有表現力,並且沒有錯字或漏字等怪異現象。現今基於大型語言模型(LLM)的 TTS 系統,由於文本和音訊在語言模型內部的表示方式存在根本性不匹配,被迫要在速度、品質和可靠性之間做出取捨。

TADA(Text-Acoustic Dual Alignment)透過一種創新的標記化架構,解決了這種不匹配,實現了文本與語音的一對一同步。其結果是:現今最快速的 LLM TTS 系統,擁有具競爭力的語音品質、幾乎零內容幻覺,以及足夠輕巧的體積,能夠在裝置上部署。

Hume AI 開源 TADA,旨在加速邁向高效、可靠語音生成的進程。程式碼和預訓練模型現已提供。

對於每一秒的口語音訊,聲學訊號所攜帶的資訊遠比對應的文本多。一秒的音訊可能對應 2-3 個文本標記,但卻有 12.5-25 個聲學訊框。這種不匹配意味著基於 LLM 的 TTS 系統必須管理音訊標記遠多於文本標記的序列——這導致了更長的上下文視窗、更高的記憶體消耗、更慢的推理速度,以及模型更容易失去對要說內容的追蹤。

大多數現有系統透過降低音訊訊框率或在文本和音訊之間引入中間的「語義」標記來解決這個問題。這兩種方法都帶來了各自的權衡:表現力下降、複雜性增加,或兩者兼有。

TADA 採取了不同的路徑。我們沒有將音訊壓縮成較少固定速率的離散音訊標記訊框,而是將音訊表示直接對齊到文本標記——每個文本標記對應一個連續的聲學向量。這創造了一個單一的、同步的串流,文本和語音在語言模型中同步前進。

對於輸入音訊,一個編碼器配備一個對齊器,從對應於每個文本標記的音訊片段中提取聲學特徵。對於輸出音訊,LLM 的最終隱藏狀態作為一個條件向量,供一個流匹配頭使用,該頭生成聲學特徵,然後這些特徵被解碼成音訊,並饋送回模型。

由於每個 LLM 步驟對應於一個文本標記和一個音訊訊框,TADA 以更少的計算量更快地生成語音。而且由於該架構強制執行文本和音訊之間嚴格的一對一映射,因此模型在構造上無法跳過或產生幻覺內容。

TADA 以 0.09 的即時因子(RTF)生成語音——比同等級的 LLM TTS 系統快 5 倍以上。這是可能的,因為 TADA 每秒音訊只處理 2-3 個訊框(標記),而其他方法則為每秒 12.5-75 個標記。

我們的模型在大規模的、實際的數據上進行了訓練,沒有進行後訓練,並達到了與在較小規模的精選數據集上訓練的模型相同的可靠性。我們透過將字元錯誤率(CER)高於 0.15 的任何樣本標記為異常來衡量幻覺率——這個閾值可以捕捉到無法理解的語音、跳過的文本和插入的內容。在 LibriTTSR 的 1000 多個測試樣本中,TADA 產生了零幻覺。

在富有表現力的長篇語音(EARS 資料集)的人類評估中,TADA 在說話者相似度方面得分為 4.18/5.0,在自然度方面得分為 3.78/5.0,總體排名第二——領先於幾個在顯著更多數據上訓練的系統。

裝置部署:TADA 足夠輕巧,可以在手機和邊緣裝置上運行,無需雲端推理。對於建置語音介面的裝置製造商和應用程式開發人員來說,這意味著更低的延遲、更好的隱私,以及沒有 API 依賴。

長篇和對話式語音:TADA 的同步標記化比現有方法具有顯著更高的上下文效率。傳統系統在約 70 秒的音訊中耗盡 2048 個標記的上下文視窗,而 TADA 在相同的預算下可以容納大約 700 秒的音訊。這為長篇旁白、擴展對話和多輪語音互動打開了大門。

生產可靠性:我們的測試中零幻覺表明,需要處理的邊緣案例更少,客戶投訴更少,產品中的後處理開銷也更少。這使得 TADA 非常適合在醫療保健、金融和教育等受監管或敏感環境中部署語音。

長篇語音退化:雖然模型支援超過 10 分鐘的上下文,但我們注意到在長篇生成過程中偶爾會出現說話者漂移的情況。我們的線上拒絕採樣策略顯著減少了這種情況,但尚未完全解決。我們建議將上下文重置作為一種中間的權宜之計。

模態差距:當模型與語音同時生成文本時,與純文本模式相比,語言品質會下降。我們引入了語音自由引導(Speech Free Guidance, SFG)技術,該技術混合了純文本和文本-語音推理模式的 logits,以幫助縮小這個差距,但仍需要更多工作。

規模:目前的版本涵蓋英語和七種額外語言,因此有明顯的擴展空間。我們正在使用 Hume AI 的數據訓練具有更廣泛語言覆蓋範圍的更大模型。

我們發布 TADA 是因為我們相信這種架構為該領域開闢了一個富有成效的方向,並且我們希望加速進程。我們邀請研究人員和開發人員在此基礎上進行開發——無論是將標記器擴展到新的模態,解決長上下文問題,還是為新應用程式調整框架。

TADA 現已根據開源授權提供。我們發布了 10 億和 30 億參數的 Llama 模型,以及完整的音訊標記器和解碼器。

10 億參數(英語):huggingface.co/HumeAI/tada-1b

30 億參數(多語言):huggingface.co/HumeAI/tada-3b-ml

演示:huggingface.co/spaces/HumeAI/tada

arXiv:https://arxiv.org/abs/2602.23068