跳到主要內容
2026-09-22 日報
前瞻與傳聞

據傳 DeepSeek 正訓練 2T 參數模型,並計畫未來打造 8T 參數規模

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

根據 Reddit 與 X 平台流傳的未經證實消息,DeepSeek 目前正在訓練一款 2T(2 兆)參數的模型,並計畫最終打造 8T 參數規模的模型。 該消息同時列出 DeepSeek 現有模型的具體規模:Flash 版本參數為 552B;Pro 版本總參數為 1.6T,其中每個 token 啟用的活躍參數為 49B。此外,傳聞中提及名為「Mythos / Fable」的模型,估計其參數規模高達 10T。目前 DeepSeek 官方尚未證實上述訓練計畫與數據。
讀原始報導

這則事件的發展

  1. 2026-09-20DeepSeek 調整 API 計費規則:中國法定節假日與調休週末全天按空閒時段計費
  2. 2026-09-19網路傳聞 DeepSeek 具備全新模型架構,官方尚未證實
  3. 2026-09-16傳 DeepSeek 聘請高瓴創投合夥人嚴文韜任首任 CFO,為 2027 年科創板 IPO 鋪路
  4. 2026-09-10據報 DeepSeek 籌備科創板 IPO,並預告 9 月 10 日發布 V4.1 Flash 模型
  5. 2026-09-08據報 DeepSeek 千兆瓦級算力擴張面臨電力挑戰,尚未解決供電銜接問題
本期分類
相關主題