跳到主要內容
2026-10-02 日報
模型發布

微軟發布 MAI-Transcribe-2-Streaming 即時語音轉錄模型,延遲僅 0.13 秒,並推出 MAI-Voice-2.1

Techmeme綜合 2 家報導多家報導
核實資料不足

多個報導來源提及此事;未必是彼此獨立的證據。

查證回合用盡,未形成有依據結論

微軟於 10 月 1 日宣布推出首款即時串流語音轉文字模型 MAI-Transcribe-2-Streaming,並同步發布 MAI-Voice-2.1 與 MAI-Voice-2.1-Flash 兩款語音生成模型。 MAI-Transcribe-2-Streaming 支援 60 種語言,具備連續自動語言偵測能力,無須手動設定即可識別對話中的語言變化。延遲表現方面,模型在接收音訊後約 100 毫秒內可生成首批部分文字;據 Artificial Analysis 測試,其最終轉錄延遲為 0.13 秒,詞錯誤率為 2.50%,在 28 款同類模型中位列第一。 定價部分,該模型目前優惠價為每小時 0.54 美元(非串流版 MAI-Transcribe-2 為每小時 0.10 美元),可透過 Microsoft Foundry、MAI Playground 與 OpenRouter 存取。 此外,官方文件顯示 MAI-Voice-2.1 模型支援 23 種語言,並具備受限的即時語音複製(gated instant voice cloning)功能。
讀原始報導

背景

MAI-Transcribe 是由 Microsoft AI 團隊開發的語音轉文字模型,適用於影片字幕、會議記錄與客服文件等應用場景。MAI-Voice 則是微軟的文字轉語音模型系列,主打高保真度與豐富的情感表現能力。

來源