Google 發布 Gemini 3.8 Flash TTS 雙模型:支援自然語言生成語音、30 秒聲音複製與逐句情緒控制
新模型支援逾百種語言與雙人對話生成,在 Hume AI 語音設計跑分奪冠,現已於 Google AI Studio 上線。
71 則值得知道的變化
新模型支援逾百種語言與雙人對話生成,在 Hume AI 語音設計跑分奪冠,現已於 Google AI Studio 上線。
新功能由 GPT-6 Astra 等模型驅動,Plus 用戶可語音建立文件與網站,免費版亦支援外掛,並提供手機至桌機的無縫接力。
該模型專為胸部與腹部 3D CT 分析設計,能生成結構化診斷報告並模仿放射科醫師進行多輪對話,目前作為研發基礎模型開放。
新系列涵蓋語音辨識、文字轉語音與即時互動,具備情緒感知能力,ASR、即時模型與 TTS 價格分別調降 95%、85% 與 70%。
採用 Omni Causal AR 與實時加速雙層架構,將多模態輸入統一進因果自迴歸框架,用戶可透過指令即時改變場景角色與劇情。
官方稱該車載模型普通任務能力媲美十倍參數的雲端模型,並透過軟硬體最佳化使推論加速五至六倍,記憶體佔用減少逾半。
包含 Flash 與 Flash-Lite 雙版本,API 支援定義多角色對話與不同聲音風格。實測顯示生成 78 秒音訊僅需 20 秒,成本約 2.74 美分。
該模型能掃描壓縮文字影像,透過學習工具僅將相關頁面展開為未壓縮形式,社群已提供 GGUF 格式,模型採 Apple 研究授權。
該模型能以 1 秒分塊即時輸出語者標籤,填補本地語音 Agent 辨識說話者身分的空白,並已獲 Transformers 零日整合。