跳到主要內容
2026-08-27 日報
模型發布

史丹佛啟動 Marin 535B-A23B 模型公開訓練:預計處理 18.75 兆 Token,全程公開程式碼與 Loss 曲線

InfoQ 中國多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

史丹佛大學基礎模型研究中心(CRFM)主任 Percy Liang 宣布啟動基礎模型專案 Marin 535B-A23B 的訓練。 該模型為混合專家(MoE)架構,總參數達 5,350 億,每處理一個 Token 啟動約 230 億參數。訓練計畫預計處理 18.75 兆 Token(80% 用於預訓練,20% 用於中期訓練),總計算量約 2.7×10^24 FLOPs。 硬體與基礎設施方面,模型運行於 11 套 NVIDIA GB200 NVL72 系統,基於 JAX、XLA 與 Levanter 框架,團隊並為 JAX/XLA GPU 環境自行實作了專家平行(Expert Parallelism)。 架構設計上,每層保留 2 個共享專家與 8 個路由專家(皆為半寬結構),共享專家提供約三分之一的計算量,以降低 Token 丟棄(Token Dropping)風險。為避免長上下文導致 Token 分布不均,預訓練從 4K 上下文啟動,搭配新型 pooled/wave 專家平行方案,將 Token 丟棄率從 65K 時的 40% 降至約 3%。 在正式訓練前,團隊先訓練了 1.6B 至 27.7B 的小型 MoE 模型作為「縮放梯」(Scaling Ladder),藉此提前發現梯度範數異常,並加入 logit z-loss 以確保數值穩定性。 Marin 專案採用「開放實驗室」機制,透過 GitHub Issue 提前聲明目標,以 Pull Request 提交配置,並公開 W&B 訓練指標,全程記錄成功、失敗與修改痕跡。
讀原始報導

背景

Weights & Biases (W&B) 是一個 AI 開發者平台,主要用於訓練、微調以及管理從實驗到生產階段的模型。在此次 Marin 專案中,研究團隊即是透過 W&B 平台來對外公開其大模型的即時訓練指標。

來源