技術

Gemini 3.8 Live 用同步唇形取代AI客服的空白臉

Adrian Kessler
在 Google 中新增我們

這套系統名為 Gemini 3.8 Live with Live Avatar,將 Google 的語音對語音模型與即時影片層結合,在生成唇部動作和臉部表情的同時,也能在背景處理工具呼叫,不必中斷對話。系統會自動偵測語言,虛擬化身可在通話中途切換口語,不需要轉接、重新載入系統,也不會出現可察覺的停頓。

它與影片疊加技術的不同之處,在於音訊和影片生成是在同一條即時推論流程中運作,而非依序完成。這種整合將延遲控制在足以維持自然對話節奏的程度。Google 會將 SynthID 浮水印以不易察覺的方式嵌入音訊與影片輸出;每一秒內容都帶有可供機器讀取的標記,指出內容由 AI 生成,即使串流經過錄製並於日後重播也一樣。浮水印在重新編碼後仍會保留,因此匯出的片段仍可進行來源驗證。

負責在印度各地部署企業方案的 Equal AI,最清楚呈現這項技術在實際營運規模下能做到什麼:九種印度語言可同時運作,每日處理超過一百萬通即時電話,支援語言總數則達 97 種。若要讓真人客服人員達到相同的可用程度與排班涵蓋範圍,這種通話量在經濟上並不切實際。這項部署背後的設計前提不是概念驗證,而是處理量。

這次推出方案未公開的是價格。Google 尚未公布費用,並引導有意者洽詢企業銷售團隊。若要建立自訂虛擬化身,也就是讓機構以自有參考圖片打造形象,必須經過獨立的驗證流程,取得企業帳戶許可,並非可自行申請使用。Live 模型的 Extended Thinking 功能仍處於私人預覽階段,推理深度因此不及 Google 其他 Gemini 產品。目前也尚未公布同時進行的工作階段數量上限。這種受限的推出方式符合 Google 分階段發布企業產品的慣例:價格與容量透過協商決定,而非對外公布。

Gemini 3.8 Live with Live Avatar 現已可透過 Gemini Enterprise 控制台及 Live API 使用,服務端點設於美國和歐盟。至於 Live 模型的 Extended Thinking,除了目前參與私人預覽的使用者群體,Google 尚未公布進一步開放的時間表。

部署這項技術的企業,將回答一個技術本身無法解答的問題:移除自動化互動中那個一眼可辨的視覺訊號,究竟能改善使用者體驗,還是會抹去人們得知自己正在與自動化系統互動的最後一個誠實標記?

標籤: , , , , ,

在 Google 中新增我們

討論

共有 0 則留言。