Google 發布 Gemini 3.8 Flash TTS 雙模型:支援自然語言生成語音、30 秒聲音複製與逐句情緒控制
已查原文 · 5 項主張
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
經查證,報導中關於 Google 發布 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 雙模型的各項功能(超過100種語言、2000多種預設語音、30秒聲音複製)、效能評分、未來的混音功能及浮水印與同意驗證安全機制,皆與 Google 官方發布的資訊完全相符,所有重要主張均獲證實。
發布 Gemini 3.8 Flash TTS 與 Flash-Lite TTS 兩款模型,支援超過 100 種語言,已於 API 推出,Gemini Enterprise API 將後續開放。
官方資料確認推出兩款新模型與逾100種語言支援,並預告企業版 API 存取權限。
Gemini 3.8 Flash-Lite TTS
查看原始出處
API in Gemini Enterprise
查看原始出處
support more than 100 languages
查看原始出處
Flash TTS 專為深度創意打造可生成新聲音;Flash-Lite TTS 針對高用量最佳化;兩者提供超過 2000 種語音庫及 30 秒聲音複製。
來源證實兩款模型的定位差異、內建超過2000種預備語音以及30秒聲音複製功能。
Create entirely new voices
查看原始出處
Optimized for high-volume dubbing
查看原始出處
2,000+ production-ready voices
查看原始出處
30-second audio sample
查看原始出處
支援逐句語氣指導、單腳本雙人對話、非語言及附和語腳本控制;未來將推出語音混音功能。
原文提及腳本控制包含單行語氣、雙人對話及笑聲等非語音選項,且將推出Voice Remixing。
directions for each line
查看原始出處
two-voice mode generates dialogue
查看原始出處
Voice Remixing
查看原始出處

背景
在語言學中,「backchanneling」是指聽者在對方說話時,穿插口語或非口語的回應以表達專注或理解。Google 新推出的 Gemini 3.8 TTS 模型系列,便支援對這類細微的語音互動進行精細控制,讓開發者能打造出更自然生動的語音體驗。
來源
- Hacker Newsblog.google
- The Decoderthe-decoder.com
- en.wikipedia.org
- blog.google