開發生態
OpenAI 披露 GPT-Live 語音底層架構:p95 音訊幀延遲降至舊版 p50 水準,連線往返縮至 1 次
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,OpenAI 發布工程文章披露 GPT-Live 語音系統底層架構,耗時 6 個月重寫後,新系統的 p95 音訊幀延遲已降至舊版 p50 的水準。
系統捨棄傳統單向對話,改採多路即時傳輸網路:快速通道處理情緒隨動,深度通道由 GPT-5.5 處理複雜推理,搜尋與工具呼叫則移至非同步背景執行。
為解決 Python 高併發下的停頓問題,媒體前端與部分推理邏輯改以 Go 語言編寫,並透過 Linux SO_REUSEPORT 實現 UDP 負載平衡。
網路層面開發自訂 WARP 協定,將 WebRTC 建立從 6 次網路往返(RTT)縮短至 1 次,並將路由提示寫入 ICE ufrag 以省去跨網路查詢。
針對打斷與狀態管理,GPT-Live 將回合檢測交由語音模型本身判斷,並支援舊實例持續對話、同時啟動新實例進行 Prefill 的無縫遷移機制。
官方目前尚未公布具體延遲毫秒數、持續推理增加的運算成本,以及長會話壓縮後的資訊損失比例。
讀原始報導背景
WebRTC 是一個免費且開源的專案,透過應用程式介面(API)為網頁瀏覽器與行動應用程式提供即時通訊功能,讓音訊與視訊不需安裝外掛程式即可直接進行點對點傳輸。OpenAI 在最新的 GPT-Live 語音系統中,為了降低音訊延遲,特別針對標準 WebRTC 協定的連線過程進行了大幅改造。