跳到主要內容
2026-10-07 日報
研究與評測

網友實測為 21M 模型外掛 6.4B 參數查找表,效能媲美 114M 密集模型且可於 SSD 運行

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 網友分享,一項個人研究專案成功將 6.4B 參數的查找表(Lookup Table)接入 21M 參數的小型模型,其效能媲美在同等 500M Wikipedia token 訓練下的 114M 密集模型(Dense Model)。 該專案採用 16.8M 列的查找表,每個 token 僅需使用 33M 參數。透過 NVMe SSD 進行記憶體映射(Memory-mapped)讀取 4-bit 查找表,模型無需將表載入 VRAM,在 RX 9070 顯示卡上僅耗用 0.4 GB VRAM 即可達到約 140 tok/s 的生成速度。然而,處理長提示詞時速度較慢,因每次未命中列(missed row)都會消耗 4 KB 的 SSD 頁面讀取。 開發者為此編寫了 Triton kernel,可無縫運行於 Radeon、MI350X 及 H100/H200 等硬體。此外,實測顯示將此查找表直接外掛於已訓練完成的 Qwen3.5-0.8B 模型並未帶來顯著效益,表現未優於同等算力的微型密集附加元件。該專案模型與程式碼已開源至 GitHub(sparse-memory-lm),開發過程曾使用 Claude Code 輔助。
讀原始報導
本期分類