技術

10秒錄音複製你的聲音,ElevenLabs v4能說90種語言

Susan Hill
在 Google 中新增我們

ElevenLabs 推出 Eleven v4,這款文字轉語音模型能把文字唸出來,並按照作者的要求加入笑聲、嘆息,或帶著怒意的法國口音。它的即時聲音複製功能只需要一段比語音留言還短的錄音,複製出的聲音之後能說數十種語言,同時保留原有的音色。任何人只要有 ElevenLabs 免費帳戶,就能使用這項功能。

對以聲音創作的人來說,這能省下好幾天的工夫。Podcast 主持人可以用自己的聲音將一集節目配音成日文;獨立遊戲開發者不用預約錄音室,就能讓每個配角都擁有鮮明不同的說話方式;有聲書旁白配音員則可以直接在稿子裡標註停頓或輕笑。另一方面,風險也同樣具體:一則語音訊息、一段視訊通話錄音,或幾秒鐘的公開貼文音訊,現在都足以成為素材,複製出足以亂真的某個人聲音。

這次最大的改變在於操控性,而複製聲音本身只需要 10 秒音訊。ElevenLabs 先前的模型能流暢地朗讀文字,卻得自行推測情緒。第 4 版可以讀取以方括號直接寫在文字中的舞台指示,例如 [laughs] 或 [said angrily in French accent],甚至也能處理 [light rain] 或 [phone buzzing] 這類背景提示。公司表示,模型也會從前後文判斷語氣和節奏,因此緊張場景中的台詞即使沒有標註,也會以緊張的語氣呈現。多位說話者同場的場景中,每個聲音也能在較長篇幅裡保持一致;這正是合成旁白過去的弱點,聲音往往會在一章內容唸到一半時逐漸走樣。

支援語言從上一版的 70 種增加到 90 多種。根據 TechCrunch 報導,ElevenLabs 特別指出,日文、巴西葡萄牙文、華語和粵語的品質進步最顯著。複製出的聲音即使切換語言,也能保留原本的聲音特徵;因此,西班牙語使用者的複製聲音即使改用德語朗讀,聽起來仍像本人,而且帶有地道的德國口音。另一款模型 v4 Turbo 則是為語音助理和客服中心專員打造,約 150 毫秒便會開始說話,差不多就是兩人在對話中輪流發言之間的停頓時間;它甚至能在背後的聊天機器人還沒寫完回答前,就先開口說話。

這個市場並非只有 ElevenLabs 一家。Google、OpenAI、Cartesia、Deepgram 和 Fish Audio 都向同一批開發者販售合成語音。產品推出後幾小時內,獨立評測機構 Artificial Analysis 就將 v4 排在語音排行榜首位;排行榜由聽眾並排聆聽匿名樣本後評分。ElevenLabs 也表示,在與競爭對手進行的盲測比較中,約四分之三的聽眾偏好 v4;不過,這個數字來自該公司自行進行的測試。

疑慮首先來自那個「10 秒」的數字。ElevenLabs 表示,複製聲音必須取得上傳者所複製之聲音本人的同意;公司也運行公開分類器,能標記出使用其工具製作的音訊,並全面禁止複製部分政治人物的聲音。這些檢查能防範一時起意的濫用,但仍仰賴上傳者說實話;詐騙者只需要取得親友一小段聲音樣本,就能假扮對方打電話,謊稱遇上緊急狀況。免費方案的額度也不多:根據 Unite.AI 對各方案的整理,每月約可生成 10 分鐘音訊;付費方案則從每月 6 美元起。

Eleven v4 和 v4 Turbo 於 9 月 28 日在 ElevenLabs 的創作者應用程式、代理平台及開發者 API 上線。這家總部位於倫敦的公司在 2 月獲 Sequoia 投資 5 億美元,當時估值達 110 億美元;TechCrunch 報導,其年化營收已突破 6 億美元。執行長馬蒂·斯坦尼斯澤夫斯基(Mati Staniszewski)告訴 TechCrunch,公司目標是在未來幾年上市,但尚未承諾具體日期。

對創作者來說,能在 90 種語言中依指示發笑的聲音,就像把錄音室放進瀏覽器分頁裡。對其他人而言,這又多了一個理由:當電話那頭傳來熟悉的聲音開口要錢時,先掛斷,再回撥確認。

標籤: , , , , ,

在 Google 中新增我們

討論

共有 0 則留言。