跳到主要內容
2026-09-10 日報
研究與評測

網友實測以 10 至 12 張 RTX 3090 運行 285B DeepSeek-V4-Flash-Vision-Exp,解碼速度最高達 120 tok/s

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit r/LocalLLaMA 論壇網友分享(尚未經官方驗證),成功在 10 至 12 張消費級 RTX 3090 顯示卡上運行 `deepseek-ai/DeepSeek-V4-Flash-Vision-Exp` 模型。 該模型為 285B MoE 架構,權重達 157 GB,實測採用 FP4 專家(experts)與 FP8 注意力機制(attention)混合精度。效能數據顯示,在 10 張 GPU(TP2xPP5,功耗限制 240W)搭配 DSpark 推測解碼(k=3)下,解碼速度達 60+ tok/s;在 12 張 GPU(TP4xPP3)環境下則可達 120+ tok/s,長上下文預填充(prefill)速度約為 3,500 tok/s。 實測指出,視覺、推測解碼與工具呼叫功能皆可正常運作。在無卸載情況下支援 1M 上下文,若啟用記憶體卸載(RAM offload)則可達 4M。作者已在 GitHub 開源建置指南與運行時修補程式,並提供相容 SM86 架構 vLLM 的 Docker 映像檔,修補內容涵蓋視覺 ViT 記憶體不足(OOM)修復、DSpark 推測解碼與 FlashInfer 相關最佳化。
讀原始報導

這則事件的發展

  1. 2026-09-02DeepSeek V4 開源多模態模型權重,揭露 32 層 ViT 與專屬 MoE 視覺路由機制
本期分類