Google 發布 Gemini 3.8 Flash TTS 雙模型:支援自然語言生成語音、30 秒聲音複製與逐句情緒控制
新模型支援逾百種語言與雙人對話生成,在 Hume AI 語音設計跑分奪冠,現已於 Google AI Studio 上線。
Google DeepMind綜合 2 家一手來源
71 則值得知道的變化
新模型支援逾百種語言與雙人對話生成,在 Hume AI 語音設計跑分奪冠,現已於 Google AI Studio 上線。
該模型專為胸部與腹部 3D CT 分析設計,能生成結構化診斷報告並模仿放射科醫師進行多輪對話,目前作為研發基礎模型開放。
新系列涵蓋語音辨識、文字轉語音與即時互動,具備情緒感知能力,ASR、即時模型與 TTS 價格分別調降 95%、85% 與 70%。
該模型能同時預測影片與動作,規劃未來的距離翻倍,並支援微調應用於機器人、遊戲與電腦操作等視覺決策場景。
採用 Omni Causal AR 與實時加速雙層架構,將多模態輸入統一進因果自迴歸框架,用戶可透過指令即時改變場景角色與劇情。
官方稱該車載模型普通任務能力媲美十倍參數的雲端模型,並透過軟硬體最佳化使推論加速五至六倍,記憶體佔用減少逾半。
包含 Flash 與 Flash-Lite 雙版本,API 支援定義多角色對話與不同聲音風格。實測顯示生成 78 秒音訊僅需 20 秒,成本約 2.74 美分。
該模型能掃描壓縮文字影像,透過學習工具僅將相關頁面展開為未壓縮形式,社群已提供 GGUF 格式,模型採 Apple 研究授權。
該基準將模型能力分為六級並設 29 個評測維度,首批測試顯示 HappyOyster 2.0、GPT-6-Astra 與 MiniMax-H3 分別在三大賽道領先。