Mustafa Suleyman 為他的新職責已準備許久。Suleyman 是微軟首任 AI 執行長,但在公司於三月中旬進行大規模重組後,他已卸下部分職務,將重心轉移到追求超級智慧。儘管此消息直到上個月才公開,但他告訴 The Verge,他為這次轉變已準備了長達九個月的時間——儘管與 OpenAI 重新協商合約是正式「解鎖微軟追求超級智慧能力」的關鍵,但他在此之前就已開始規劃。

「這是一個長久以來的計畫,」他說,並補充說實現超級智慧是「我唯一的焦點」。

超級智慧——以及 AGI,或稱通用人工智慧——在 AI 產業中定義模糊且不斷變動。對 Suleyman 而言,這純粹與商業和生產力有關。「超級智慧實際上是關於『這些模型是否有能力為數百萬依賴我們提供世界級語言模型的企業,交付產品價值?』」Suleyman 說。「這確實是我們的重點。我們希望為開發者、企業以及眾多消費者提供服務。」AI 公司面臨著越來越大的營收壓力,而微軟的計畫也呼應了 OpenAI 的新策略。

微軟的重組將其企業和消費者團隊整合在 Copilot AI 品牌之下。雖然 Suleyman 仍將負責宏觀策略,但原任微軟 AI 產品與成長企業副總裁的 Jacob Andreou,已升任執行副總裁,領導新整合團隊的工程、成長、產品和設計等事務。這次轉變為 Suleyman 騰出了時間,讓他能專注於追求超級智慧和開發微軟的新前沿 AI 模型,這在領先 AI 公司之間的競爭——以及吸引新付費消費者和企業客戶的壓力——比以往任何時候都更加激烈。

週四,微軟推出了一款新的轉錄模型,希望能達成此目標——Suleyman 表示,由於其「GPU 成本僅為其他頂尖模型的另一半」,這對微軟來說是「巨大的成本節省」。

該公司將 MAI-Transcribe-1 標榜為「推動語音辨識的邊界」,其能力涵蓋 25 種語言的會議轉錄、影片字幕生成和客服通話分析。微軟發布該模型的部落格文章指出,它專為「具挑戰性」的錄音條件而設計,包括背景噪音、低品質音訊和語音重疊,並結合了「人工策劃」和機器轉錄的文本進行訓練。Suleyman 表示,原始錄音數據混合了受控的錄音室數據,以及承包商在各種背景噪音(從繁忙的街道到孩子們跑來跑去)下自行錄製的音訊,再加上「來自開放網路的大量數據」。

連同現有的語音和圖像生成模型 MAI-Voice-1 和 MAI-Image-2,這款新的轉錄模型現已在 Microsoft Foundry 上提供,並包含在新版 Microsoft AI Playground 中。根據微軟的說法,這是這些模型「首次廣泛可用於商業用途」。MAI-Transcribe-1 可處理 MP3、WAV 和 FLAC 格式的音訊檔案。

Suleyman 將新模型在測試中的表現歸功於一個僅有 10 人的精簡團隊。他說,該模型團隊「擺脫了任何官僚體系」,因為有專門的團隊負責管理供應商、尋找可下載的數據等。微軟在語音和圖像生成方面也採用了類似策略,其他公司也採取了類似舉措——Meta、Amazon 和 Google 都在實驗簡化組織結構,而 Anthropic 也表示正在實驗讓小型開發團隊在一定計算資源下自由發揮,以觀察他們能取得什麼成就。

這款新的轉錄模型是 Suleyman 旨在提供「以人為本」AI(這是微軟偏好的 AI 術語「人文主義超級智慧」的一個變體)目標的一部分,使其對日常使用者有用。「每個人都將在口袋裡擁有一個真正世界級的 AI 助理,它對他們負責,站在他們這邊,符合他們的利益,並代表他們工作,」他說。