開發生態
OpenAI 發布 GPT-Live 工程報告:分離媒體與應用邏輯,並引入 WARP 降低 WebRTC 啟動延遲
AI 前線單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 InfoQ 報導,OpenAI 近期發布 GPT-Live 工程報告,解析其連續有狀態語音互動架構。系統透過非同步 RPC 邊界,將對延遲敏感的即時路徑(媒體處理管道與推論迴圈)與任務委派、工具呼叫及資料持久化等應用邏輯分離,確保語音傳輸不受外部服務延遲影響。
OpenAI 即時 AI 負責人 Justin Uberti 表示,GPT-Live 採用專用的有狀態推論機制。每個會話會在分配的實例上預留運算資源;當實例釋放資源或會話接近上下文限制時,系統可將會話上下文即時遷移至具備可用容量的新實例,以動態調整實例數量。
在傳輸層方面,OpenAI 繼續採用具備內建錯誤復原功能的 WebRTC,並引入 WARP(WebRTC Abridged Roundtrip Protocol)最佳化方案與即時連線機制以降低服務啟動延遲。WARP 包含 SPED、DTLS 1.3 與 SNAP 等可獨立部署的改進,現有 WebRTC 應用程式無需更改程式碼即可受惠。
此外,系統在正式上線前進行了「靜默測試」,在無使用者憑證的唯讀模式下導入真實語音流量,並直接丟棄模型輸出結果。此測試捕捉到真實會話的多樣性,並發現了傳統合成測試無法涵蓋的負載異常,例如部分地區 GPU 與提供資料的 CPU 未部署於同一機房所導致的意外延遲。
讀原始報導