OpenAI 週四表示,其 API 現在將包含一系列新的語音智慧功能,旨在幫助開發者創建能夠與使用者進行語音對話、轉錄和翻譯的應用程式。

該公司新的 GPT‑Realtime‑2 是另一個語音模型,旨在創建逼真的語音模擬,能夠與使用者進行對話。然而,與其前身(GPT-Realtime-1.5)不同的是,這個模型是基於 GPT‑5 等級的推理能力構建的,OpenAI 表示這是為了處理使用者更複雜的要求而創建的。

該公司還推出了 GPT‑Realtime‑Translate,正如其名稱所示,旨在提供能夠在對話中「跟上」使用者語速的即時翻譯服務。該功能包含超過 70 種輸入語言(即它可以理解的語言)和 13 種輸出語言(即它向說話者傳達的語言)。

最後,該公司還推出了一項新的轉錄功能 GPT-Realtime-Whisper,使用戶能夠獲得即時的語音轉文字功能,這些功能會在互動發生時被捕捉下來。

該公司表示:「我們推出的模型共同將即時音訊從簡單的呼叫和響應,轉變為能夠真正完成工作的語音介面:在對話展開時進行聆聽、推理、翻譯、轉錄和採取行動。」

這些更新對誰有好處?想要擴展客戶服務能力的企業顯然是目標客戶。然而,OpenAI 也指出,其新功能將有助於教育、媒體、活動和創作者平台等廣泛領域。

儘管這些工具從企業角度來看非常有用,但它們似乎也有可能被濫用。該公司表示,它已經建立了安全措施,以阻止其新功能被濫用於創建垃圾郵件、詐騙或其他形式的線上濫用。系統中嵌入了特定的觸發器,以便「如果偵測到對話違反我們的有害內容準則,就可以中止對話」,OpenAI 表示。

所有新的語音模型都包含在 OpenAI 的 Realtime API 中。Translate 和 Whisper 按分鐘計費,而 GPT-Realtime-2 則按代幣消耗量計費。