企業級 AI 平台,賦能現代職場生產力
智慧搜尋與探索系統,挖掘商業洞察
高效能模型,支援代理式、多模態、多語言 AI
語音辨識模型,生成高準確度音訊轉錄稿
代理式編碼模型,專為實務軟體工程打造
領先的多模態搜尋與檢索工具
強大模型,提升搜尋品質的語意表現
您專屬、安全的模型推論平台 — 由 Cohere 管理
Cohere 研究實驗室,致力於解決複雜機器學習難題
探索企業 AI 案例研究與成功故事
無與倫比的轉錄準確度 — 我們邁向賦能企業語音智慧的第一步。
AI 並非捷徑,而是企業領先的關鍵。
Cohere 今日宣布推出 Transcribe,這是一個最先進的自動語音辨識(ASR)模型,現已開源並可供下載。
語音正迅速成為 AI 驅動工作負載與自動化的核心模式,從會議轉錄、語音分析到即時客戶支援代理。
我們的目標很明確:在實際應用條件下,推動專用 ASR 模型準確度的極限。該模型從頭開始訓練,刻意著重於最小化詞錯誤率(WER),同時將生產就緒性放在首位。換句話說,它不僅是一個研究成果,更是一個為日常使用而設計的系統。
Cohere Transcribe 正體現了這一意圖。它可供開源使用,並提供完整的基礎設施控制權;其推論足跡可控,適合實際的 GPU 和本地利用;它提供業界頂尖的服務效率;同時也可透過 Cohere 的安全、全託管模型推論平台 Model Vault 取得。
Cohere Transcribe 目前在 HuggingFace 的 Open ASR Leaderboard 上準確度排名第一,為真實世界的轉錄效能樹立了新的標竿。
這標誌著我們將高效能語音辨識導入企業 AI 工作流程的「從零到一」的里程碑。請繼續閱讀以了解更多。
圖 1:Cohere Transcribe 是一個開源權重的 Conformer ASR 模型,可將語音音訊轉換為文字,支援 14 種語言。
Cohere Transcribe 是英文語音辨識準確度的最新標準。它以平均 5.42% 的詞錯誤率(WER)領先 HuggingFace Open ASR Leaderboard,超越了包括 Whisper Large v3、ElevenLabs Scribe v2 和 Qwen3-ASR-1.7B 在內的所有開源及閉源專用 ASR 替代方案。這體現了該模型在真實語音任務中的多樣化能力,例如在多聲源環境、會議室式聲學條件(例如 AMI 資料集)以及不同口音(例如 Voxpopuli 資料集)下的魯棒性。
圖 2:Hugging Face Open ASR Leaderboard(截至 2026 年 3 月 26 日)。這是一個廣泛使用、標準化的基準測試,透過詞錯誤率(WER)作為主要指標,在經過整理的資料集上評估自動語音辨識系統。WER 是在正規化的參考-假設對齊上計算得出的,WER 越低表示轉錄保真度越高。在此處查看即時排行榜。
關鍵是,這些進步不僅限於基準測試資料集。我們在人類評估中也看到了相同的最先進效能,訓練有素的審查員會評估真實音訊的準確度、連貫性和可用性。兩種評估方法的結果一致,證實了 Cohere Transcribe 的效能可以從受控測試可靠地轉移到實際的企業環境中。
在生產環境中,ASR 系統必須在嚴格的延遲和吞吐量限制下運行;即使準確,緩慢或資源密集型的轉錄也會直接影響使用者體驗、營運效率和成本。
Transcribe 擴展了帕累托前沿,在 10 億參數以上模型群組中,在實現最先進準確度(低 WER)的同時,維持了業界頂尖的吞吐量(高 RTFx)。
Paige Dickie Radical Ventures 副總裁
我們正致力於將 Cohere Transcribe 更深入地整合到 Cohere 的 AI 代理協調平台 North 中。隨著計畫中的更新,Cohere Transcribe 將從一個高準確度的轉錄模型,發展成為企業語音智慧的更廣泛基礎。
Cohere Transcribe 現已可在 Hugging Face 下載。請遵循設定說明在本地運行該模型,甚至在邊緣環境中運行。
您也可以透過我們的 API 免費存取 Cohere Transcribe,進行低設定的實驗,但受速率限制。請參閱文件以了解使用細節和整合指南。
主要貢獻者:Julian Mack(技術人員)、Ekagra Ranjan(技術人員)、Cassie Cao(產品經理)、Bharat Venkitesh(技術主管)、Pierre Harvey Richemond(技術主管)。
AI 並非捷徑,而是企業領先的關鍵。
我們將為您提供最新資訊。