前瞻與傳聞
據傳 DeepSeek 正訓練 2T 參數模型,並計畫未來打造 8T 參數規模
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
根據 Reddit 與 X 平台流傳的未經證實消息,DeepSeek 目前正在訓練一款 2T(2 兆)參數的模型,並計畫最終打造 8T 參數規模的模型。
該消息同時列出 DeepSeek 現有模型的具體規模:Flash 版本參數為 552B;Pro 版本總參數為 1.6T,其中每個 token 啟用的活躍參數為 49B。此外,傳聞中提及名為「Mythos / Fable」的模型,估計其參數規模高達 10T。目前 DeepSeek 官方尚未證實上述訓練計畫與數據。
讀原始報導這則事件的發展
本期分類
相關主題