跳到主要內容
2026-09-24 日報
模型發布

Google 發布 Gemini 3.8 Flash TTS 雙模型:支援自然語言生成語音、30 秒聲音複製與逐句情緒控制

Google DeepMind綜合 2 家報導一手來源
已查原文 · 5 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

經查證,報導中關於 Google 發布 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 雙模型的各項功能(超過100種語言、2000多種預設語音、30秒聲音複製)、效能評分、未來的混音功能及浮水印與同意驗證安全機制,皆與 Google 官方發布的資訊完全相符,所有重要主張均獲證實。

發布 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款模型,支援超過 100 種語言,已於 API 推出,Gemini Enterprise API 將後續開放。

官方資料確認推出兩款新模型與逾100種語言支援,並預告企業版 API 存取權限。

Gemini 3.8 Flash-Lite TTS

查看原始出處

API in Gemini Enterprise

查看原始出處

support more than 100 languages

查看原始出處

Flash TTS 專為深度創意打造可生成新聲音;Flash-Lite TTS 針對高用量最佳化;兩者提供超過 2000 種語音庫及 30 秒聲音複製。

來源證實兩款模型的定位差異、內建超過2000種預備語音以及30秒聲音複製功能。

Create entirely new voices

查看原始出處

Optimized for high-volume dubbing

查看原始出處

2,000+ production-ready voices

查看原始出處

30-second audio sample

查看原始出處

支援逐句語氣指導、單腳本雙人對話、非語言及附和語腳本控制;未來將推出語音混音功能。

原文提及腳本控制包含單行語氣、雙人對話及笑聲等非語音選項,且將推出Voice Remixing。

directions for each line

查看原始出處

two-voice mode generates dialogue

查看原始出處

Voice Remixing

查看原始出處

Flash TTS 在 Hume AI 語音設計基準測試總排第一(71.4分),口音建模領先(60.8分)。

官方資料給出了完全相符的 Hume AI 基準測試評分與排名數據。

Voice Design Benchmark (71.4)

查看原始出處

accent modeling (60.8)

查看原始出處

聲音複製需提供語音所有權人口頭同意錄音驗證,生成音檔皆嵌入 SynthID 浮水印與 C2PA 憑證。

來源確認聲音複製須有同意錄音把關,且生成的音訊都帶有 SynthID 浮水印及 C2PA 憑證保護。

verbal consent recording

查看原始出處

SynthID watermarking, and C2PA credentials

查看原始出處
Google DeepMind 發布 Gemini 3.8 Flash TTS 與 Gemini 3.8 Flash-Lite TTS 兩款文字轉語音模型,支援超過 100 種語言。目前已於 Google AI Studio 與 Gemini API 推出,據報導 Gemini Enterprise API 存取權限將於後續開放。 Flash TTS 專為深度創意與角色設計打造,使用者可透過自然語言提示從頭生成全新聲音;Flash-Lite TTS 則針對高用量、低成本的配音與語音代理進行最佳化。兩款模型皆內建超過 2,000 種預備語音庫,並支援「30 秒音檔聲音複製」功能。 在語音控制方面,模型支援逐句語氣指導(如平靜或氣音)、單一腳本雙人對話生成,以及非語言聲音(如笑聲、嘆氣)與附和語(如 mhm、yeah)的腳本控制。官方預告未來將推出語音混音(Voice remixing)功能,可微調音色、音高與口音。 效能與安全方面,Gemini 3.8 Flash TTS 在 Hume AI 的語音設計基準測試(Voice Design Benchmark)中以 71.4 分取得總排名第一,口音建模項目以 60.8 分領先。為防止濫用,聲音複製功能要求提供語音所有權人的口頭同意錄音進行驗證,且所有生成的音檔皆會嵌入 SynthID 浮水印與 C2PA 憑證。
讀原始報導

背景

在語言學中,「backchanneling」是指聽者在對方說話時,穿插口語或非口語的回應以表達專注或理解。Google 新推出的 Gemini 3.8 TTS 模型系列,便支援對這類細微的語音互動進行精細控制,讓開發者能打造出更自然生動的語音體驗。

來源