跳到主要內容
2026-10-01 日報
開發生態

網友開源 llama-halo-hybrid 專案:結合 Strix Halo 與 R9700 混合推論,解碼達 60 tok/s 並支援 256k 上下文

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 網友分享,開源專案 llama-halo-hybrid 近期更新,成功實現 AMD Strix Halo APU 與 R9700(或類似外接 GPU)的混合推論。 該專案採 MIT 授權,基於 llama.cpp 修改,可透過 PCIe 擴充卡、Occulink 或 Thunderbolt 連接外接 GPU。運作原理是將模型的密集層、KV 快取及部分神經網路層交由 GPU 處理,剩餘部分由 APU 負責。 實測數據顯示,解碼速度超過 60 tok/s,預填(prefill)速度超過 2000 tok/s,並支援完整的 256k 上下文。專案主要針對 Qwen 與 GLM 家族模型進行最佳化,作者以 Q4/Q4_K_XL 量化版本的 Qwen-3.8-flash-next 與 Swift-1.5 進行測試,稱其效能超越 DGX Spark。 作者補充,若僅單獨使用 Strix Halo 進行推論,建議改用 gufo 專案。在硬體成本方面,作者指出 Framework 剛開放預購的 192GB Gorgon Halo 主機板要價 6,469 美元(每 GB 約 33.7 美元),而採用 128GB Strix 搭配 32GB R9700 的總成本約 5,000 美元,不僅效能更佳,記憶體單價也較低。
讀原始報導
本期分類