跳到主要內容
2026-10-04 日報
模型發布

開發者推出 Kyojin 引擎,單台 128GB AMD 迷你電腦可運行 300B MoE 模型,解碼達 44 tok/s

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群網友發布,開發團隊推出基於 ExLlamaV3 與 ROCm 構建的推論引擎 Kyojin,成功在單台配備 128GB 記憶體的 AMD Strix Halo(Ryzen AI Max+ 395)迷你電腦上運行兩個 300B 級別的 MoE 模型。 實測數據顯示,99.7GB 的 GLM-5.3-Flash 模型 Prefill 速度達 580 tok/s(3.5K 脈絡),解碼速度為 26 至 30 tok/s;105GB 的 MiMo-V2.6-Flash-MOPD 模型 Prefill 約 650 tok/s(4K 脈絡),程式碼解碼速度最高達 44 tok/s。 在模型權重方面,GLM 版本混合了公開的 2.05 與 3.05 bpw EXL3 張量並進行微調,與官方 FP8 相比 Top-1 一致性達 89.3%;MiMo 則採用團隊自研量化,Top-1 一致性達 92.0%。 該專案提供相容 OpenAI 格式的 API,並透過載入單一檔案支援無審查(Uncensored)版本切換。目前引擎與權重已在 GitHub 與 Hugging Face 開源,但尚未測試非 gfx1151 架構的其他 GPU 效能。
讀原始報導