技術

微軟10人團隊打造的語音模型在每項基準測試中均超越OpenAI、谷歌和ElevenLabs——每小時僅需0.10美元

Adrian Kessler

該模型名為MAI-Transcribe-2。由穆斯塔法·蘇萊曼(Mustafa Suleyman)領導的微軟AI部門,於9月3日以每音訊小時0.10美元的價格推出——該價格優惠持續至2026年底。前一代版本MAI-Transcribe-1.5的價格為每小時0.36美元。這72%的降幅並非行銷上的四捨五入。一家每年處理10萬小時音訊的客服中心,原本需為舊模型支付36,000美元;現在相同的工作量只需10,000美元。

基準測試的表現才是這一定價的特別之處。在FLEURS多語言評估中,MAI-Transcribe-2在60種語言中名列第一,平均詞錯誤率為5.2%——優於OpenAI的GPT-Transcribe、Google的Gemini 3.5 Transcribe、ElevenLabs Scribe v2以及Meta的Whisper V3-Large。在同時追蹤準確度與延遲的Artificial Analysis排行榜上,它總體排名第二,並定義了研究人員所稱的帕雷托前緣(Pareto frontier)——即超越該邊界後,改善一個指標就必然會損害另一個指標。該模型的訓練目標是位於這條前緣的效率邊界上,而非追求任何單一指標排行榜的頂端。

速度是第二個值得檢視的主張。微軟表示,MAI-Transcribe-2處理音訊的速度比GPT-Transcribe快10倍,比ElevenLabs Scribe v2快7倍,比Gemini 3.5 Transcribe快5倍。對於長篇音訊——例如播客轉錄、法律證詞、臨床記錄——這一差異決定了工作流程是在幾秒鐘內完成還是需要幾分鐘。該模型還支援說話者日誌(識別誰在何時說話)、詞級時間戳、針對領域術語的關鍵字偏置,以及語言混雜(code-switching)支援——特別提及印地英語(Hinglish)和西語英語(Spanglish)作為測試範例。

開發該模型的團隊規模與其成果形成鮮明對比。微軟描述核心團隊僅10人,運作時內部官僚程序極少,並有較大的團隊支援數據獲取與供應商管理。其具體的GPU效率主張是:MAI-Transcribe-2的GPU運算成本僅為其他同級最先進模型的一半。在企業級負載下此說法是否成立,無法從本次公告中驗證,但架構上的宣稱足夠精確,可供測試。

該模型現已可在Microsoft Foundry、MAI Playground以及Open Router上取得——這意味著使用它並不需要簽署Azure合約或與微軟建立企業關係。這種分發廣度是刻意為之。微軟AI進軍直接面向開發者的API,是其在OpenAI合作關係重整後更廣泛定位調整的一部分。2025年10月與2026年4月的修訂條款,取消了自2019年以來定義雙方關係的獨家與收益分享安排。微軟現在有直接動機在模型層面進行競爭,而不只是單純分發OpenAI的輸出。

每小時0.10美元的定價標註為限時優惠至2026年底。該日期之後的標準定價尚未公布。正在評估MAI-Transcribe-2用於生產環境的買家,等於是在為一個2027年的成本尚屬未知的產品定價。即使目前的費率讓該模型在當前所有替代方案中極具吸引力,這依然是一個應該明確指出的風險。

標籤: , , , , ,

討論

共有 0 則留言。