開發生態
微軟開源 Kubernetes AI 工作負載管理平台 TauGrid,整合 Kueue 與 KubeRay 簡化 GPU 排程
AI 前線單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
查證回合用盡,未形成有依據結論
據報導,微軟開源了雲端原生平台 TauGrid,用於在搭載 GPU 的 Kubernetes 叢集上管理、排程與監控 AI 工作負載。該平台整合了 Kueue(工作負載排隊與資源管理)、KubeRay(編排)、GPU 節點健康監控與可觀測性功能,可透過單次 Helm 安裝完成部署,取代過去需手動拼湊多個開源專案與維運腳本的繁瑣流程。
在操作介面上,使用者可透過 `tau.yaml` 設定檔定義工作負載並以 `tau run` 終端機指令提交。系統會自動驗證配置並建立 Kubernetes Job 或 KubeRay RayJob,交由 Kueue 依配額與優先級排隊;執行期間會追蹤狀態與日誌,並支援從檢查點(checkpoint)恢復失敗的作業。
TauGrid 核心以 Go 語言編寫,運行環境需具備 GPU 節點的 Kubernetes 1.30+ 叢集及 Helm 3.0+。目前專案仍在開發中,官方路線圖顯示未來將支援多租戶工作區、RBAC、PyTorch DDP/FSDP、DeepSpeed 及 LoRA/QLoRA 工作流,並計畫擴展至多叢集與多雲執行環境。
讀原始報導背景
Kubernetes 是一個開源的容器編排系統,主要用於自動化軟體的部署、擴展與管理。在 Kubernetes 環境中運行 AI 工作負載時,開發者通常需要依賴如 KubeRay 這類開源工具,來簡化特定應用程式的部署與管理流程。
來源
本期分類