模型發布
Google 發布 Gemini 3.8 Live 與 Extended Thinking 語音模型:支援 97 語言與背景 API 呼叫,跑分擊敗 GPT-Live-1
Google DeepMind綜合 4 家報導一手來源
核實資料不足
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
查證回合用盡,未形成有依據結論

Google 宣布推出迄今最先進的即時對話模型 Gemini 3.8 Live 與 Gemini 3.8 Live Extended Thinking,今日起於 Gemini API、Google AI Studio 上線,並逐步整合至 Search Live、Gemini Live 與 Workspace。
Gemini 3.8 Live 專注於規模化部署與成本效益,具備近即時視覺輸入處理能力,支援對話中自動偵測並切換 97 種語言。該模型可在背景執行工具與 API 呼叫,同時保持對話流暢不中斷。
Gemini 3.8 Live Extended Thinking 針對高複雜度任務設計,具備多步推理能力,能實現「邊想邊說」。模型會使用「讓我確認一下...」等提示詞自然回應,並即時口述多步背景任務的處理進度。
在效能評測上,Extended Thinking 版本在 Artificial Analysis 語音對語音品質指數以 82.6 分奪冠,領先 OpenAI 的 GPT-Live-1;在 τ-Voice 任務完成率達 68.6%,Sierra 的 τ-Voice-banking 基準測試達 35.1%,Big Bench Audio 得分 97.7%。3.8 Live 則在 Speech Agent Arena 排名第二。兩款模型在 ServiceNow EVA-Bench 測試中皆推高了複雜工作流的 Pareto Frontier。
定價方面,Google 音訊輸入每分鐘 0.005 美元,輸出每分鐘 0.018 美元。據 The Decoder 報導,一小時語音對話成本約 1.38 美元,大幅低於 OpenAI GPT-Live-1 的 3.00 美元。
為防範錯誤資訊,所有由新模型生成的音訊皆直接寫入 SynthID 隱形浮水印。
讀原始報導背景
τ-Voice 是一項用於評估全雙工(Full-Duplex)語音代理在真實世界領域表現的基準測試,要求模型處理複雜的多輪對話並與環境互動。在該測試中,現有語音代理在面對真實情境的語音干擾時,效能往往會出現顯著下降。
來源
- Hacker Newsblog.google
- The Decoderthe-decoder.com
- iThome 中國ithome.com
- Techmemetechmeme.com
- arxiv.org
- arxiv.org