研究與評測
Ai2 改用 GPU 時間預算與階層式公平分配,取代優先級排程管理數千張 GPU
HuggingFace Blog一手來源
核實資料不足
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
本次未取得足夠原文證據

Ai2 表示,其 AI 基礎設施團隊近期以 GPU 時間預算、階層式公平分配(hierarchical fair-share)與時間切片契約,取代原本以優先級為核心的排程器,將各研究專案應獲得多少 GPU 時間的爭議,從個案式營運處理改為透明的行政預算流程。
Ai2 管理數千張 NVIDIA H100、B200 與 B300 GPU,叢集規模介於 88 至 1024 張 GPU,服務約 150 名內部研究人員,工作涵蓋大型語言模型與視覺語言模型訓練、機器人強化學習模擬,以及科學 AI 代理的後訓練。根據已提交的工作負載,任一時點的 GPU 需求約為可用量的 2 至 3 倍。
Ai2 將排程成效分成四層:硬體可用率(availability)、可分配給特定工作負載的時間占比(occupancy)、資源是否分配給最具價值的工作(impact),以及工作負載生命週期內實際使用的 GPU 容量比例(utilization)。這次改造主要聚焦於提升排程決策的 impact。
舊制允許工作負載選擇不接受搶占,並以優先級與各團隊的並行 GPU 上限管理資源。Ai2 觀察到,使用者會在 GPU 上停放無操作工作負載,以便需要時快速接手;由於優先級持續膨脹,最終所有已排程工作都使用 HIGH 優先級,較低優先級工作因而無法取得 GPU 時間。非搶占工作負載也讓值班工程師需要花大量時間協調關閉,才能處理執行所在主機的維護問題。
Ai2 此後不再直接把一組 GPU 的壟斷權交給團隊,而是分配 GPU 時間份額。管理者可依據研究專案預期影響力,事先決定各專案的 GPU 時間資源,再由排程器利用這些分配結果處理後續工作負載;這種做法保留資源所有權誘因,同時避免研究需求具有季節性時造成 GPU 閒置。
讀原始報導