技術

Gemini 3.5 Transcribe上線:Google語音AI支援85種語言,自動修正口誤

Adrian Kessler

Gemini 3.5 Transcribe 不只是捕捉說話內容,而是將對方說的話轉換成他們真正想表達的意思。當說話者中途修正自己的話——「我們約星期二,不對,星期三」——模型只輸出「星期三」,並捨棄修正過程。填充詞自動消失,背景噪音也不影響。最終產出的是經過修整、格式化的文字,而非原始語音擷取。

對於任何錄製訪談、Podcast 或多語言內容的人來說,這一區別決定了整個工作流程。市面上每套轉錄工具都能處理「說了什麼」,而後續由人工編輯負責清理的工作,則涵蓋了其他所有環節。Google 現在就把這個編輯功能直接內建在模型裡。

該模型支援兩條不同的 API 路徑。Live API 負責連續雙向串流,延遲低於亞秒級——專為即時語音代理、客服機器人以及任何需要即時轉錄的場景設計。Interactions API 則處理已錄製的音訊:完整會議、通話紀錄與訪談,並回傳最多三位發言者的說話者標記與時間戳。兩者在串流模式下達成 4.0% 的字錯誤率,非串流模式則為 2.6%——數據由獨立評測機構 Artificial Analysis 測得。Google 上一代語音轉文字模型 Chirp 3 需要多花 70% 的時間才能完成最終轉錄。

此次發布的消費者端應用則較為低調。在 Android 上,Gboard Rambler 已採用 Gemini 3.5 Transcribe 進行語音輸入。Gemini macOS 應用程式則透過「Speak to Window」功能支援英文語音輸入。Chrome 整合被標註為「即將推出」,屆時使用者將可在任何網頁欄位——回覆、貼文、表單——直接進行語音輸入,無需切換應用程式。該功能尚未公布具體上線日期。

模型的限制同樣值得注意。多人說話者標記最多僅支援三位參與者;超過此數量的座談會或圓桌會議需要繞道處理。消費者端的 Rambler 應用目前僅在「特定國家與語言」中提供,並非模型所支援的全部 85 種語言。Google 尚未公布 API 的定價,該 API 目前透過 Google AI Studio 進行公開預覽。企業端則透過 Gemini Enterprise Agent Platform 取得,定價另議。對於小型創作者而言,成本問題仍懸而未決。

競爭格局同樣值得關注。OpenAI 的 Whisper 仍是獨立開發者的預設選擇,其英文音訊的字錯誤率約在 5% 至 7% 之間,且需要額外撰寫後處理程式碼來移除填充詞與格式化。AssemblyAI 與 Deepgram 等服務提供說話者分離功能,但沒有 Gemini 3.5 Transcribe 預設套用的內建自然語言校正。差距確實可量測,但在更困難的 85 種語言範圍——包含區域口音、低資源語言、吵雜環境——中表現如何,仍需獨立測試驗證。

最能反映 Google 長期方向的功能是 Chrome 整合。一旦語音輸入能在任何網頁欄位中運作,該模型就不再只是開發者工具,而成為人們輸入文字基礎設施。該功能的推出時間表尚未確認。

標籤: , , , , ,

討論

共有 0 則留言。