技術

OpenAI語音AI不再等待你說話 — 每分鐘$0.05

Susan Hill

當今市場上的所有語音AI都要求你等它說完再開口。OpenAI的GPT-Live-1則不然。這款透過OpenAI API提供的模型能夠同時聆聽和說話——處理打斷、停頓和重疊語音,就像人在通話時那樣。

定價:語音層每分鐘收費0.05美元——30分鐘對話1.50美元,或每1,000分鐘對話50美元。開發者需另外支付推理後端的費用:OpenAI自家的GPT-6 Astra或任何能處理工具呼叫和業務邏輯的相容模型。語音層負責對話機制;推理層決定AI實際說些什麼和做什麼。

這種分離在實際中的意義:客服機器人可以在句子中間聽到「等等,其實我想要另一個選項」並做出回應,而不是硬著頭皮講完準備好的答案。語言導師可以在學生對某個單字結巴的時候及時指出,而不必等到他們說完。預訂系統可以處理那種現實中的通話——人們會重複自己說過的話、改變主意、互相搶話。

在專門設計來測試同步雙向語音處理的Full Duplex Bench評估中,GPT-Live-1的得分比其前身GPT-Realtime-2.1高出30個百分點。當與GPT-6 Astra作為推理後端搭配時,它在Tau3(測試複雜多步驟查詢且無通話中斷的客服基準測試)中名列前茅。

雙層架構反映了一個刻意的設計選擇。語音時序和推理分別計費,因為它們的擴展方式不同:一家建立輕量級家教應用程式的新創公司在兩層上的支出都比使用GPT-6 Astra執行數千個同步客服通話的企業來得少。語音層每分鐘最低收費0.05美元,無論後端運行的是什麼。

GPT-Live-1沒有改變的是回答的品質。語音層處理的是AI何時以及如何說話——而不是它知道什麼。一個時機恰當的糟糕答案仍然是糟糕答案。建立客服應用程式的開發者需要分別評估兩個層,而推理後端可能比語音層本身增加更多的帳單費用。OpenAI也沒有公布關於全雙工架構在低頻寬環境或噪音電話線路上的表現數據,在這些情況下,持續的音訊輸入更難維持。

GPT-Live-1現已可在OpenAI的API中使用。該公司尚未宣布基於此模型的消費者端產品,不過它已表示未來版本的ChatGPT語音模式可能採用相同的底層架構。每分鐘0.05美元的費率在推出時適用;OpenAI尚未公布價格變動時間表或獲准與語音層一起使用的第三方推理模型清單。

標籤: , , , , ,

討論

共有 0 則留言。