跳到主要內容
2026-08-04 日報
研究與評測

AirLLM 支援 Kimi K3 2.8T,單張 RTX 6000 Ada 僅用 3.72GB VRAM 推論

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

AirLLM 於 2026 年 7 月加入 Kimi K3 2.8T 支援,端到端實測可在單張 RTX 6000 Ada 上以 3.72GB VRAM 執行這款開源模型。其做法是針對稀疏 MoE 模型逐一串流專家,每個 token 僅載入實際路由到的專家,而非一次載入完整模型層。 AirLLM 可在不量化、蒸餾或剪枝的情況下,讓 70B 模型於單張 4GB GPU 推論;Llama 3.1 405B 約需 8GB,DeepSeek-V3 671B 約需 12GB。2026 年 6 月發布的 v3.0 增加 FP8 支援,並可讓 Qwen3-235B 約以 3GB VRAM 執行,涵蓋 Qwen3、Llama 3.x/4、DeepSeek V2/V3、Phi-4 與 Gemma 等模型,統一透過 AutoModel 載入。 執行 Kimi K3 需要安裝 compressed-tensors 與 flash-attn;由於模型程式碼強制使用 flash attention,且 CUDA 13 尚無預建的 flash-attn wheel,因此須使用 CUDA 12 版 torch。其遠端程式碼無法在 transformers 5.x 載入,需使用 transformers 4.56.x。 推論前,AirLLM 會先將原始模型分解並按層儲存,因此 Hugging Face 快取目錄仍須具備足夠磁碟空間。使用者亦可啟用 4-bit 或 8-bit 區塊式權重量化,官方稱可將執行速度提高最多 3 倍;預先擷取功能則透過重疊模型載入與運算,帶來 10% 速度提升。
讀原始報導

背景

AirLLM 是一套用於降低大型語言模型推論記憶體用量的軟體。其目標是在不採用量化、蒸餾或剪枝的情況下,讓 70B 模型能以單張 4GB GPU 執行推論。

社群討論

整體肯定 AirLLM 能讓 4GB GPU 跑 70B 模型是資源受限環境下的工程突破,也期待這類嘗試推動模型架構與訓練效率;但多數人質疑實用性、維護性與文件完整度,並追問相較 llama.cpp 的 mmap/量化方案有何優勢,以及是否仍須下載完整模型並從磁碟串流各層。實測 Kimi K3 在 RTX 6000 Ada 48GB 上約需 292 秒/token(約 0.003 token/s),有人估算等量於 30 token/s 一小時產出的工作要跑 416 天、耗電約 US$124.61,因此認為 API 或甚至 CPU 推論可能更實際。

來源

本期分類