跳到主要內容
2026-09-10 日報
開發生態

招商銀行統一管理近萬張 AI 加速卡:平均利用率由 35% 升至 60% 以上、每百萬 Token 推論成本降逾 60%

AI 前線單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 AI 前線報導,招商銀行在 9 月 8 日上海舉行的 KubeCon + CloudNativeCon + OpenInfra Summit + PyTorch Conference China 2026 分享 AI 基礎設施實作:以 Kubernetes 搭配 Kueue、KEDA、Prometheus、HAMi、Fluid 建立統一控制平面,讓模型訓練、微調與線上推論共享近 10000 張異構加速卡,目前已有 99% 加速運算資源納入框架。依招商銀行公布的資料,近萬張加速卡平均利用率由 35% 提升至 60% 以上;在模型與服務條件相同下,每處理 100 萬 Token(含輸入與輸出)的推論成本下降超過 60%,但目前僅有單一來源報導,相關成效數字未有其他佐證來源。架構上,Kueue 負責訓練任務准入、佇列與配額,避免多卡訓練在資源尚未全部就緒時提前占用部分加速卡;線上推論由 Prometheus 蒐集服務負載指標,再由 KEDA 依即時訊號調整推論執行個體規模。HAMi 用於更細粒度分配訓練與推論所需的異構加速資源,Fluid 則加速訓練資料集、模型權重與 Checkpoint 存取,以減少等待資料載入造成的閒置。多租戶微調方面,自研 Twinkle 訓練框架預設可讓 5 個 LoRA 租戶共享一個基礎模型執行個體;招商銀行稱,相較各自載入一份基礎模型,對應場景可將基礎模型副本由 5 份減至 1 份,加速器資源消耗降低 80%、訓練密度提高 5 倍。此前一項 CNCF 案例中,招商銀行曾以 Kubernetes、HAMi 與拓撲感知排程,使分散式訓練工作負載的跨機器排程減少 30%;此次架構則進一步涵蓋訓練、推論與多租戶工作負載的統一資源管理。後續規劃包括動態調整多租戶訓練並行度,結合資源利用率、任務佇列與延遲指標管理單位成本,以及擴充 KEDA,讓部分推論服務在無請求時可縮容至零。
讀原始報導