跳到主要內容
2026-09-24 日報
模型發布

Google 發布 Gemini 3.8 TTS 模型,內建逾兩千種聲音並支援 30 秒音訊自訂聲音

Simon Willison單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Google 發布了兩款全新的文字轉語音模型:gemini-3.8-flash-tts 與 gemini-3.8-flash-lite-tts。新模型內建超過 2,000 種聲音庫,並支援自訂聲音功能,使用者只需提供 30 秒擁有使用權的音訊樣本,即可建立專屬聲音。 該 API 支援輕鬆定義多角色對話,可為不同角色設定專屬聲音與風格指示。開發者 Simon Willison 透過 Gemini API 開放的 CORS 政策,利用 GPT-6 Astra 建立了一個自帶金鑰(BYOK)的測試介面。實測顯示,使用 Gemini 3.8 Flash TTS 模型生成一段 1 分 18 秒的雙角色對話音訊(腳本由 Claude 4.5 Opus 生成),耗時約 20 秒,成本為 2.74 美分。
讀原始報導
相關主題