跳到主要內容
2026-08-10 日報
開發生態

開發者分享 32GB 記憶體運行 DSv4 300B MoE 實測:透過重新打包與推測預取克服讀取瓶頸

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群 LocalLLaMA 上的開發者分享,其成功在 32GB 記憶體的筆電上運行 DSv4 300B MoE 模型。由於 MXFP4 專家權重池高達約 147GB 無法完全載入記憶體,開發者將其餘部分常駐於 RAM,並透過硬碟串流讀取專家權重。實測發現,系統瓶頸主要在於讀取速度而非運算核心。 開發者針對讀取瓶頸提出了幾項關鍵最佳化方法與觀察: 首先是重新打包(Repacking)模型,將其改為層級優先(layer-major)格式,使每層的專家權重成為連續區塊,將原本緩慢的隨機讀取轉為全速的連續讀取,速度可達約 7GB/s。 其次,在預填(Prefill)階段,若提示詞大於 2k tokens,運算時間足以掩蓋讀取延遲。為解決路由前無法預知所需專家的問題,開發者採用推測專家預取(speculative expert prefetch)技術,利用路由提示在計算第 l 層時,提前讓 SSD 讀取第 l+1 層的專家。 此外,實測發現作業系統的頁面快取(page cache)反而會拖慢效能,因為資料從 SSD 傳至 CPU 再到 GPU 會產生雙重緩衝(double-buffering),消耗大量傳輸頻寬,導致整體速度慢上約 3 倍。 最後,開發者指出即使是僅約 30 個 tokens 的短提示詞,仍會觸發 43 層中絕大多數的專家,導致運算時間完全被龐大的讀取時間掩蓋,因此這類部署方式的首字延遲(TTFT)始終難以降低。
讀原始報導

背景

混合專家(MoE)模型體積龐大,目前已有透過固態硬碟(SSD)串流載入權重的技術,讓記憶體有限的消費級硬體也能執行推論。此外,新聞中提及的 MXFP4 是一種區塊浮點(BFP)格式,透過讓多個有效位數共用單一指數來節省硬體空間。

來源

本期分類
相關主題