前瞻與傳聞
據報 OpenAI 內部算力優先分配給 Codex 而非 Sora,主因影片生成負載連續且獨占難以排程
AI 科技評論單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,OpenAI 執行長 Sam Altman 於 8 月 23 日的播客節目中透露,因算力資源限制,內部團隊與算力投入已優先傾斜至 Codex,而非影片生成模型 Sora。兩者資源博弈的關鍵在於工作負載架構的差異:Sora 的算力消耗是連續且獨占的,而 Codex 的算力是碎片且可複用的。
Sora 在生成影片時,需將原始影片壓縮至 latent space 並切分為時空 patch,其視覺 token 數與時間、高度、寬度呈三維乘法關係。由於每輪 diffusion 迭代皆需處理變動的時空狀態,Sora 無法如大型語言模型般透過歷史紀錄攤薄成本。此外,影片時長與解析度差異會形成不同的 tensor shape,導致伺服器端難以有效進行 batch 處理,單次請求會長時間占用 GPU。
相對而言,Codex 的 Agent 工作流由多輪 Prefill、Decode 與工具呼叫組成。當 Agent 執行編譯、測試或等待 I/O 時,GPU 可立即釋放並服務其他 sequence。系統能透過 prompt caching 減少重複 prefill,並利用 continuous batching、PagedAttention 分頁管理 KV cache,甚至將偏重計算吞吐的 prefill 與依賴記憶體頻寬的 decode 拆分至不同 GPU 池,藉由動態排程讓同一批 GPU 交錯服務大量併發任務。
讀原始報導背景
OpenAI 的影片生成模型 Sora 與程式碼生成模型 Codex 在算力調度架構上存在顯著差異。Codex 能夠透過 continuous batching 等技術將多個請求合併處理,藉此充分利用運算資源。相比之下,Sora 的算力需求較為連續且獨占,難以透過類似機制攤薄成本。