研究與評測
開發者在 M5 Max MacBook Pro 運行 2.8T 參數 Kimi K3,透過四顆 SSD 串流達成 1 token/s 解碼速度
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
開發者透過 Deltafin 專案分支,在配備 128 GB 記憶體的 M5 Max MacBook Pro 上,成功運行完整未壓縮的 2.8T 參數 Kimi K3 MoE 模型。該實作保留完整的 1.45 TB 專家權重與 16 個路由專家,未採用其他專案降至約 3 bits 的量化作法,而是搭配 Kimi-K3-DSpark 或 Qwen 等小模型進行推測解碼以提升速度。實測數據顯示,透過四顆 SSD 串流專家權重,生成 512 token 的穩定解碼速度為 1.00 tok/s,128 token 為 1.13 tok/s。目前預填充(Prefill)階段會將每層專家重複讀取 8 次,導致 512 token 提示詞的首字延遲高達約 6.3 分鐘(約 376 秒)。硬碟擴充測試指出,單顆 SSD 速度約為四顆的 52%,兩顆約 73%,三顆約 90%;整體速度取決於每層 16 次讀取中最慢的節點,而非總頻寬。
讀原始報導