跳到主要內容
2026-10-02 日報
研究與評測

Allen AI 發布開源 MoE 訓練框架 Olmo-core 3,支援兆級參數擴展,吞吐量較前代提升 2.7 倍

HuggingFace Blog一手來源
已查原文 · 4 項主張

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

報導關於 Allen AI 發布 Olmo-core 3 框架的核心主張均屬實。官方原文證實該框架支援將 MoE 模型擴展至兆級參數,且吞吐量較前代顯著提升達 2.7 倍。此外,報導提及的各項具體測試數據(如 1.2 兆參數模型測試、擴展至 47B 時吞吐量下降不到 5%、MXFP8 格式提升 21% 吞吐量等)皆與官方部落格發布的基準測試結果完全吻合。

Olmo-core 3 支援兆級參數擴展,吞吐量較前代的實作提升約 2.7 倍。

官方公告確認該框架旨在擴展至兆級參數,並在 8 張 B300 GPU 測試中達到前代約 2.7 倍的吞吐量。

scale MoE training into the trillion-parameter range

查看原始出處

2.7× the throughput.

查看原始出處

在擴展測試中,總參數增至 47B 時,訓練吞吐量下降不到 5%。

原文指出將專家數量增加使總容量從 4.6B 增至 47B 時,吞吐量降幅小於 5%。

fell by less than 5%.

查看原始出處

官方在 512 張 GPU 上成功測試了 1.2 兆參數模型。

原文提到他們在 512 張 GPU 上測試了 1.2 兆參數模型。

1.2-trillion-parameter model

查看原始出處

新增支援 MXFP8 低精度格式,吞吐量較 BF16 提升約 21%。

對照測試中顯示,啟用 MXFP8 格式使訓練吞吐量比 BF16 基準提高了約 21%。

21% higher than with BF16

查看原始出處
Allen AI 發布開源 MoE(混合專家)訓練基礎設施 Olmo-core 3,專為將 MoE 模型訓練擴展至兆級參數規模而設計。此框架為下一代 Olmo 模型的核心系統。 新版框架在架構上進行重大調整,從先前的完全分片資料平行(FSDP)轉向基於分散式資料平行(DDP)的系統。新架構讓專家常駐於 GPU 上並直接路由相關資料,避免了重複收集權重的通訊開銷。在 8 張 NVIDIA B300 GPU 的初步測試中,訓練 47B 參數 MoE 模型的吞吐量達每 GPU 每秒 52,000 tokens,是早期 FSDP 實作(19,400 tokens)的約 2.7 倍。 在擴展性基準測試中,當專家數量從 8 個增加至 128 個(總參數從 4.6B 增至 47B,每個 token 活躍參數維持約 3.2B)時,訓練吞吐量下降不到 5%。官方並在 512 張 B300 GPU 上成功測試了 1.2 兆參數模型(每個 token 活躍 58.36B 參數)。 為提升運算與路由效率,Olmo-core 3 結合了專家平行、管線平行與分散式最佳化器,並引入 Rowwise 專家平行、GPU 常駐路由與 Grouped GEMM 等最佳化技術。此外,框架新增支援 MXFP8 低精度格式;在 4 張 B300 GPU 的對照測試中,啟用 MXFP8 較 BF16 基準的端到端訓練吞吐量提升約 21%,峰值活躍記憶體則從 103 GiB 降至 95 GiB。
讀原始報導

背景

OLMo-core 是一個提供 PyTorch 建構區塊的開源框架,專門用於開發大型語言模型。混合專家(MoE)架構能透過僅啟動部分參數來提升運算效率,但隨著模型擴展,跨 GPU 叢集的通訊與協調成本也會隨之增加。

來源

本期分類