跳到主要內容
2026-09-11 日報
模型發布

GigaChat-3.5-Reasoning 432B MoE 模型採 MIT 授權開源,稱效能逼近 DeepSeek V4 Flash Preview

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息指出,GigaChat 團隊發布全新推理模型 GigaChat-3.5-Reasoning,並以 MIT 授權將權重開源於 Hugging Face。該模型採用 432B 總參數、28B 啟動參數(432B-A28B)的混合專家(MoE)架構,並結合 Gated DeltaNet 以提升長文本處理效率。開發團隊表示,其訓練過程先使用 CISPO 訓練程式碼與數學等領域專家,再透過同策略蒸餾(on-policy distillation)整合成單一模型。官方評測宣稱,其效能接近 DeepSeek V4 Flash Preview,且在推理軌跡(reasoning traces)上減少了 37% 的 token 使用量,目前已開放於官網測試。
讀原始報導