xAI 開源 314B 參數 Grok-1 MoE 模型,採 Apache 2.0 授權並登上 GitHub Trending
該模型採 8 專家混合架構,每次啟用 2 個專家,支援 8K 上下文,可透過 Torrent 或 Hugging Face 下載,需極大 GPU 記憶體。
GitHub Trending (python)單一來源
24 則值得知道的變化
該模型採 8 專家混合架構,每次啟用 2 個專家,支援 8K 上下文,可透過 Torrent 或 Hugging Face 下載,需極大 GPU 記憶體。
採 Apache 2 授權,支援 26 萬上下文。實測顯示預設 xhigh 推理設定會讓簡單任務耗時逾 20 分鐘,建議本機部署時調低等級。
團隊以 880 億 token 語料訓練 0.6B 至 5B 模型,證實擴展規模、GRPO 或上下文學習皆無法解鎖預訓練範圍外的知識。