跳到主要內容
2026-07-29 日報
模型發布

OpenAI推兩款語音轉錄模型

X @OpenAIDevs綜合 2 家報導
OpenAI 在 API 推出 GPT-Live-Transcribe 與 GPT-Transcribe,前者主打低延遲即時轉錄,後者用於已完成音檔的非同步轉錄與批次工作。官方表示,兩款模型能更理解上下文,提升跨語言、口音及高噪音環境下的轉錄準確度。GPT-Transcribe 的 AA-WER 為 3.31%、排名第 9,較 GPT-4o Transcribe 改善 0.7 個百分點;處理速度約為即時的 34 倍,價格降低 25%至每千分鐘 4.50 美元。
讀原始報導

背景

GPT-Live-Transcribe 是串流語音轉文字模型,適合需要從即時音訊取得低延遲逐步轉錄結果的應用;GPT-Transcribe 則可處理已完成的音訊檔案、串流檔案轉錄,以及透過 WebSocket 進行的 Realtime 工作階段。兩者分別面向即時與批次轉錄,並可處理自訂詞彙、背景噪音及多語言語音。

來源