跳到主要內容
2026-09-11 日報
開發生態

Together AI 推出 GPU 叢集搶占式運算,固定半價計費並提供 5 分鐘中斷緩衝期

Together AI一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Together AI 宣布在所有區域的 Kubernetes 叢集推出 GPU 叢集搶占式運算(preemptible compute)公開預覽版。該服務費率固定為隨需(on-demand)價格的 50%,不隨現貨市場波動;採次小時(sub-hourly)計費,每 1 至 2 分鐘計量一次。 搶占式節點使用閒置的 GPU 容量,當資源被回收時,系統會提供最多 5 分鐘的排空(drain)緩衝期。觸發回收時,Pod 會收到 `SIGTERM` 訊號與 `TogetherPreempted` 事件,讓工作負載有時間建立檢查點(checkpoint)並退出。節點移除後,系統會在容量釋出時自動補充,無需手動請求。 在架構上,搶占式節點並非獨立叢集,而是透過 `together.ai/compute-class=preemptible` 標籤加入現有叢集。每個叢集至少需要一個標準節點來運行關鍵組件,且目前無法就地轉換節點的運算類型。 此功能適合短期實驗、快速微調與批次推論等可中斷任務。官方以 321B 參數的 GLM5.3 Flash 模型為例,其 3.5TB 的檢查點寫入平行檔案系統約需 22 秒至 4 分鐘,可於 5 分鐘緩衝期內完成。官方預計下一步將加入 Slurm 支援與運算類型就地轉換功能。
讀原始報導