模型發布
Reddit 社群彙整最新本地模型跑分:涵蓋 DeepSeek-V4-Flash 與 Qwen3.8,Opus-4.8 於 GPQA 達 93.6
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit r/LocalLLaMA 社群網友整理,近期多款最新本地模型與 Opus-4.8 的跑分數據對比表曝光。該表據稱是透過 GLM-5.3 從各模型的官方 Hugging Face 頁面彙整而成。
在參數規模上,DeepSeek-V4-Flash 系列總參數約 284B 至 285B(啟動 13B),GLM-5.3-Flash 為 320B(啟動 18B),Qwen3.8-Flash-Next 為 125B(啟動 6B),Qwen3.8-27B 為 27B 稠密模型。
通用評測 GPQA Diamond 中,未公開參數的 Opus-4.8 以 93.6 領先,Qwen3.8-Flash-Next 達 91.7,DeepSeek-V4-Flash-0731 為 90.8。
程式能力方面,SWE-bench Pro 測試中 Opus-4.8 獲 69.2,Qwen3.8-Flash-Next 獲 62.5;SWE-bench Multilingual 測試中 Opus-4.8 達 84.4,Qwen3.8-Flash-Next 為 81.0。
代理能力(Agentic)方面,Opus-4.8 在 Terminal Bench 2.1 獲 85.0、NL2Repo 獲 69.7;DeepSeek-V4-Flash-Vision-Exp 在 Terminal Bench 2.1 達 83.9,GLM-5.3-Flash 則在 DeepSWE 取得 61.1。
讀原始報導