模型發布
xAI 開源 314B 參數 Grok-1 MoE 模型,採 Apache 2.0 授權並登上 GitHub Trending
GitHub Trending (python)單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
xAI 正式在 GitHub 開源 Grok-1 模型權重與 JAX 範例程式碼,隨即登上 GitHub Trending。Grok-1 為 314B 參數的混合專家(MoE)模型,採 8 專家架構,每個 token 啟用 2 個專家。硬體規格包含 64 層網路、48 個 Query 注意力頭與 8 個 KV 注意力頭、嵌入維度 6,144,並使用詞表大小 131,072 的 SentencePiece tokenizer。該模型支援旋轉位置編碼(RoPE)、activation sharding 與 8-bit 量化,最大上下文長度為 8,192 tokens。官方提供 Torrent 磁力連結與 Hugging Face Hub 兩種下載方式,原始碼與模型權重皆採 Apache 2.0 授權。官方特別註明,由於模型體積龐大,測試需具備充足 GPU 記憶體的設備;且目前儲存庫中的 MoE 層實作未經最佳化,此設計是為了避免使用自訂 kernel,以單純驗證模型的正確性。
讀原始報導背景
Grok-1 採用的 Mixture of Experts (MoE) 是一種機器學習技術,透過多個專家網路來劃分問題空間,能以較少的運算資源進行預訓練並大幅擴展模型規模。此外,其開源的範例程式碼基於 JAX,這是一個專為高效能數值運算與大規模機器學習設計的 Python 函式庫。