跳到主要內容
2026-08-08 日報
開發生態

大模型推理推動 AI SSD 架構轉移:Mooncake 提升請求承載量達 498%,NVIDIA CMX 增設 G3.5 快閃記憶體層

量子位綜合 2 家報導多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

隨著大模型進入長上下文與多代理階段,AI 基礎設施正從單純堆疊算力,轉向協同運算、網路、記憶體與儲存資料路徑,將 SSD 納入 Token 生成的即時主鏈路。月之暗面與清華大學發表於 USENIX FAST ’25 的 Mooncake 採用以 KV Cache 為中心的分離式架構,將 Prefill 與 Decode 部署於不同資源池,並將 CPU、DRAM、SSD 與 NIC 組織成分布式快取池。該系統在真實請求軌跡下,將有效請求承載能力提升 59% 至 498%,目前已於數千個節點運行,每日處理逾 1,000 億個 Token。 NVIDIA 則推出 CMX(Context Memory Storage Platform),在 GPU HBM(G1)與共享儲存(G4)之間增設以快閃記憶體為介質的 Pod 級 G3.5 上下文記憶體層。CMX 透過 BlueField-4 與 Spectrum-X 乙太網路提供 PB 級共享容量,官方稱其在長上下文負載下的 Token 吞吐量與功耗效率最高可達傳統方案的 5 倍。 在硬體端,除了英韌科技洞庭-N3X 與華為 OceanDisk LC 560 等針對高頻快取最佳化的企業級 SSD 外,市場亦出現三條「推理參與型 AI SSD」路線。群聯 aiDAPTIV 透過專用快取 SSD 與中介軟體擴展 GPU 記憶體,提供最高 100 DWPD 耐久度;江波龍採用 5 奈米 SPU 與 iSA 軟體架構,由儲存側執行硬體壓縮與快取調度;寅譜與聯芸則透過軟體定義晶片與近存運算,貫通中介軟體、韌體與 NAND 介質,根據模型執行順序預測並載入 MoE 專家權重與 KV Cache。
讀原始報導

背景

隨著大型模型進入長上下文與複雜推理階段,AI 基礎設施的瓶頸逐漸從單純的 GPU 算力,轉移至運算、網路、記憶體與儲存資料路徑的協同管理。為了解決 KV Cache 佔用資源與重複計算的問題,業界開始將 SSD 等儲存設備納入 Token 生成的即時主鏈路中。例如月之暗面的 Mooncake 架構與 NVIDIA 的 CMX 平台,皆致力於將推理狀態轉變為可獨立調度的基礎設施資源。

來源