開源專案 Strata 支援在消費級顯卡部署 125B 模型 Qwen3.8-Flash-Next,RTX 3090 生成可達 100-140 tokens/s
專案最低需 12GB VRAM 與 32GB 記憶體,提供多種量化版本,官方正式版模型更預設支援達 100 萬 token 上下文長度。
Hacker News單一來源
28 則值得知道的變化
專案最低需 12GB VRAM 與 32GB 記憶體,提供多種量化版本,官方正式版模型更預設支援達 100 萬 token 上下文長度。
Google 在 Hugging Face 上架全新多模態模型 DiarizationLM-Gemma-4-E4B-v1,支援圖文輸入,並提供 llama.cpp、Ollama 等多種部署工具的具體程式碼範例。