開發生態
開源推理框架 Colibrì 支援將 SSD 當顯示記憶體,無 GPU 筆電可運行 744B GLM-5.2 與 2.8T Kimi K3 模型
量子位單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
查證回合用盡,未形成有依據結論

據量子位報導,GitHub 上一款名為 Colibrì 的純 C 語言開源推理框架,透過將 NVMe SSD 作為顯示記憶體(VRAM)的擴充,使無 GPU 的一般電腦也能運行千億甚至兆級參數的大型語言模型。
該框架針對 MoE(混合專家)架構設計,將模型分為常駐與臨時呼叫兩部分,建立 VRAM、記憶體(RAM)與 NVMe SSD 的分層儲存系統。以 744B 參數的 GLM-5.2 為例,經 int4 量化後約 372GB 的權重中,Attention 等每次推理必用的密集(Dense)部分約 9.9GB 直接常駐記憶體,而佔用約 370GB 的 19456 個路由專家則存放於 SSD,僅在 Router 命中時動態讀取。
為解決讀取延遲,Colibrì 導入 LRU 快取機制保留高頻專家,並能以 71.6% 的準確率提前預測下一層所需的專家,將計算與 SSD I/O 重疊,同時支援雙 SSD 平行讀取。據專案實測,GLM-5.2 在 12 核心 CPU 與 25GB 記憶體的開發機上冷快取速度約 0.05 至 0.1 token/s;在 128GB 記憶體的純 CPU 桌機可達 1.8 token/s;若配置 6 張 RTX 5090 讓全數專家常駐高速儲存層,則可達 5.8 至 6.8 token/s。
專案目前支援 9 個模型家族,包含 284B 的 DeepSeek V4 Flash、975B 的 Inkling,以及最大 2.8T 參數的 Kimi K3(需約 1.6TB 儲存空間與最低 32GB 記憶體起步)。Colibrì 提供 Linux、macOS 與 Windows 預先編譯版本,並內建 Web Dashboard 供使用者即時視覺化各專家的儲存層級與呼叫熱度。
讀原始報導本期分類