模型發布
香港團隊 Blockway 發布 Agens Volundr 32B 預覽版:採混合架構,72 層僅 18 層保留 KV cache
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據香港開發團隊 Blockway 在 Reddit 透露,已開源發布(Apache-2.0)混合架構模型 Agens Volundr 32B Preview。為解決長上下文的記憶體瓶頸,該模型 32B 參數的 72 層網路中,僅 18 層保留 KV cache,支援 262K 上下文。
其架構包含 54 層無 KV cache 的 KDA(Kimi Delta Attention)線性注意力層、17 層 BCSA 壓縮稀疏注意力層、1 層全注意力層,並採用 4 條殘差流(mHC),另於主機記憶體附加 Engram 雜湊 n-gram 記憶體。
團隊實測指出,在兩張 48GB GPU 執行 BF16 推論,從 1K 到 128K 上下文的解碼速度穩定維持在 23.9 至 25.1 tok/s;搭配專屬 DFlash2 投機解碼模型,JSON 與工具輸出速度最高提升 3.6 倍。評測方面,官方宣稱在 LiveCodeBench v6、HumanEval 及 MATH-500 等程式與數學基準測試微幅領先 Qwen3.8-27B,但在代理任務(tau2-bench、SWE-bench)表現落後。
目前該模型尚未支援標準版 sglang、vLLM 或 llama.cpp,需使用團隊專屬的 sglang 構建版本部署。
讀原始報導