開源推理框架 Colibrì 支援將 SSD 當顯示記憶體,無 GPU 筆電可運行 744B GLM-5.2 與 2.8T Kimi K3 模型
該純 C 語言框架針對 MoE 架構設計,將常駐權重留存記憶體並動態從 SSD 讀取路由專家,GLM-5.2 在 128GB 記憶體下速度約 1.8 token/s。
量子位單一來源
34 則值得知道的變化
該純 C 語言框架針對 MoE 架構設計,將常駐權重留存記憶體並動態從 SSD 讀取路由專家,GLM-5.2 在 128GB 記憶體下速度約 1.8 token/s。
蘋果公開各裝置對應的模型規模,M5 Ultra Mac Studio 單機可承載 4,800 億參數,展現統一記憶體架構的推理優勢。
由 vLLM 團隊創立的 Inferact 透過 Pallas 語言整合推論程式,搭配 DeepSeek 框架,在 16 塊 TPU 上跑出每秒 709 token 的成績。
該架構借鑒 Apache Spark,由 Worker 模型平行處理局部上下文,再由 GRPO 訓練的 Driver 模型統整證據,在 LongBench v2 評測提升 9.8 分。
該方案無需微調,透過預填提示詞與 vLLM 讀取特定 token 機率,使語言模型達到與 Jev 相當的決策速度與準確度,並額外支援圖像輸入。