開發生態
vLLM 獲社群支援專家記憶體卸載,實測可於四張 R9700 運行 DeepSeek-V4
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit r/LocalLLaMA 社群消息,推論框架 vLLM 在開發者 tcclaviger 的貢獻下,已新增專家記憶體卸載(Expert RAM Offloading)支援,大幅降低本地部署大型前沿模型的硬體門檻。
網友 sloptimizer 釋出的實測結果顯示,透過 Docker 部署並啟用 `--enable-expert-offload` 與 `--expert-offload-mem 160`(分配 160GB 系統記憶體)等參數,成功在四張 R9700 GPU 上運行 `DeepSeek-V4-Flash-Vision-Exp` 模型。該實測配置同時啟用了張量平行(Tensor Parallelism)設為 4、FP8 KV Cache、前綴快取(Prefix Caching)以及分塊預填充(Chunked Prefill)等最佳化設定。目前該功能主要由社群推動,官方尚未發布正式版本公告。
讀原始報導這則事件的發展
本期分類