模型發布
微軟發布 MAI-Transcribe-2-Streaming 即時語音轉錄模型,延遲僅 0.13 秒,並推出 MAI-Voice-2.1
Techmeme綜合 2 家報導多家報導
核實資料不足
多個報導來源提及此事;未必是彼此獨立的證據。
查證回合用盡,未形成有依據結論
微軟於 10 月 1 日宣布推出首款即時串流語音轉文字模型 MAI-Transcribe-2-Streaming,並同步發布 MAI-Voice-2.1 與 MAI-Voice-2.1-Flash 兩款語音生成模型。
MAI-Transcribe-2-Streaming 支援 60 種語言,具備連續自動語言偵測能力,無須手動設定即可識別對話中的語言變化。延遲表現方面,模型在接收音訊後約 100 毫秒內可生成首批部分文字;據 Artificial Analysis 測試,其最終轉錄延遲為 0.13 秒,詞錯誤率為 2.50%,在 28 款同類模型中位列第一。
定價部分,該模型目前優惠價為每小時 0.54 美元(非串流版 MAI-Transcribe-2 為每小時 0.10 美元),可透過 Microsoft Foundry、MAI Playground 與 OpenRouter 存取。
此外,官方文件顯示 MAI-Voice-2.1 模型支援 23 種語言,並具備受限的即時語音複製(gated instant voice cloning)功能。
讀原始報導背景
MAI-Transcribe 是由 Microsoft AI 團隊開發的語音轉文字模型,適用於影片字幕、會議記錄與客服文件等應用場景。MAI-Voice 則是微軟的文字轉語音模型系列,主打高保真度與豐富的情感表現能力。