研究與評測
FreeToken 提出邊緣端 MoE 部署新技術,RTX 5090 運行 DeepSeek-V4-Flash 達 25 tok/s
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據社群消息指出,一項名為 FreeToken(arXiv:2608.16157)的新技術提出邊緣原生 MoE 部署方案,讓消費級硬體無須經過極端量化,即可使用官方權重以互動速度運行前沿模型。該技術採用頻寬自適應 CPU-GPU 執行(bandwidth-adaptive CPU-GPU execution)與跨代理輪次的語義感知快取(semantic-aware caching across agent turns)。實測數據顯示,8GB RTX 4060 筆電運行 Qwen3.6 35B 可達 39 tok/s;RTX 5090 桌機運行 DeepSeek-V4-Flash 284B 達 22-25 tok/s;RTX PRO 6000 工作站運行 GLM-5.2 753B 則為 15 tok/s。與 Ollama 相比,FreeToken 的 decode 速度提升 3 至 4 倍,prefill 速度提升 6 至 30 倍,可支援 Claude Code 或 Codex 等工具免費在本地端運行。
讀原始報導背景
隨著大型開源模型日益普及,其推論通常仍高度依賴資料中心等級的基礎設施。FreeToken 是一個專為邊緣裝置設計的混合專家(MoE)推論引擎,能將個人電腦的 GPU、CPU 與主機記憶體等異質資源整合為單一且彈性的推論平台。MoE 技術透過多個專家網路分工,能在相同的運算預算下大幅擴展模型規模。