開發生態
NVIDIA Dynamo 推出 Shadow Engine Recovery 預覽功能,LLM 故障恢復時間縮短近 39 倍
NVIDIA Developer一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

NVIDIA Dynamo 推出 Shadow Engine Recovery 預覽功能,旨在解決 LLM 推理引擎進程崩潰時,冷啟動需耗時數分鐘重新載入權重與編譯的問題。
該功能透過 GPU Memory Service (GMS) 在同一 GPU 上維持一個已初始化的閒置備用引擎(Shadow engine)。GMS 利用 CUDA 虛擬記憶體管理 API,將權重的生命週期與引擎進程脫鉤;備用引擎可直接映射並共享現有權重,無需在 HBM 中建立副本,達成零邊際權重成本。當主進程故障時,備用引擎可在數秒內接管服務。
官方實測顯示,在雙 worker 的 GLM-5.2 部署中強制終止一個 worker,傳統冷啟動需耗時 283 秒恢復;啟用 Shadow Engine Recovery 後僅需 7.3 秒,速度提升近 39 倍,大幅減少服務中斷時間。
目前 vLLM、SGLang 與 NVIDIA TensorRT-LLM 已透過自訂的 torch.cuda.CUDAPluggableAllocator 整合 GMS。官方表示,目前預覽版尚未支援將 KV 快取納入 GMS,但相關功能正在開發中,未來備用引擎將能直接接管原有快取而無需重建。
讀原始報導背景
CUDA Graphs 是一種提交 CUDA 運算任務的模式,將操作視為圖形節點,操作間的依賴關係則為邊緣。在標準的大型語言模型推論中,這類初始化狀態與特定的虛擬位址綁定,導致系統發生錯誤時無法直接轉移,必須經歷耗時的冷啟動。
來源
本期分類