模型發布
ElevenLabs 推出 v4 與 v4 Turbo 語音模型:支援 90 多種語言,10 秒素材即可克隆聲音
iThome 中國綜合 2 家報導多家報導
尚未逐項核實
多個報導來源提及此事;未必是彼此獨立的證據。
ElevenLabs 正式推出 ElevenLabs v4 與 v4 Turbo 兩款全新語音模型,支援語言數量從 70 種擴增至 90 多種,其中日語、巴西葡萄牙語、中文普通話及粵語的合成品質顯著提升。
新系列採用全新架構,用戶僅需 10 秒音訊素材即可完成聲音克隆。在朗讀長文本時,模型能更好地維持說話人音色特徵,並根據前後文語境自動調整語氣;v4 版本也擴充了內聯標籤(inline tags)功能,允許用戶疊加多個情緒標籤並按順序執行。
針對語音代理(Voice Agent)場景,新模型降低了回應延遲,能在後端大型語言模型開始輸出時同步生成音訊,並具備處理爭執、訴求升級與通話等待等情境的能力。
ElevenLabs 目前超過 55% 收入來自大型企業,年化營收已從年初約 3.3 億美元增至 6 億美元以上。公司今年稍早以 110 億美元估值獲紅杉資本 5 億美元融資,傳聞正籌備目標估值 220 億美元的新一輪融資,執行長 Mati Staniszewski 亦透露計畫於未來幾年內 IPO。
讀原始報導背景
ElevenLabs 成立於 2022 年,是一家專注於利用深度學習技術開發自然語音合成軟體的公司。該公司由波蘭創業家 Piotr Dąbkowski 與 Mateusz Staniszewski 創立,總部位於倫敦。
來源
- Reddit r/singularityreddit.com
- en.wikipedia.org