跳到主要內容
2026-08-27 日報
模型發布

Google 推出 Gemini 3.5 Transcribe 語音轉文字模型,支援雙 API 模式

Google DeepMind綜合 2 家報導一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Google 推出最新語音轉文字模型 Gemini 3.5 Transcribe,現已透過 Google AI Studio 的 Gemini API 及 Gemini Enterprise Agent Platform 向開發者開放。該模型具備智慧轉錄能力,能自動清理贅詞、處理語句自我修正並自動格式化,同時支援自訂詞彙,並可自動偵測與轉錄超過 85 種語言。 模型針對不同情境提供兩種 API 模式: 1. 即時串流(Live API,gemini-3.5-transcribe-live):專為互動式語音應用設計。據 Artificial Analysis 實測,其語音結束後延遲僅 0.40 秒,平均字錯率(WER)為 4.0%。 2. 預錄音訊處理(Interactions API,gemini-3.5-transcribe):支援說話者標記與字級時間戳記,平均 WER 為 2.6%,在 AA-WER 排行榜位居第 5 名。 此外,該模型支援 Function calling,可將影像生成等複雜任務委派給其他 Gemini 模型執行,此功能目前已在 macOS 版 Gemini 應用程式中提供。一般消費者也已能在 Android 的 Rambler 等新語音功能中體驗到該模型的技術。
讀原始報導

來源