開發生態
MiniMax攜AMD最佳化MoE推論
X @MiniMax_AI
MiniMax 與 AMD 公布針對 428B MSA 稀疏 MoE 多模態基礎模型的 ATOM 與 ATOMesh 全棧推論最佳化,並宣稱 AMD MI355X 在 MiniMax-M3 服務效能上已接近 Nvidia B200。技術升級涵蓋 EAGLE3 推測解碼、支援 1M 超長上下文的 Page-16 KV cache,以及避免視覺與 MoE 精度下降的逐層 FP8 量化。雙方也採用分散式 P/D 分離架構,以支援大規模叢集部署。
讀原始報導背景
ATOM 是 AMD 以 ROCm 為基礎的單節點推論引擎,ATOMesh 則支援多節點部署,並可將提示詞預填與解碼階段分散至不同 GPU 資源池。EAGLE3 採用推測式解碼;這類技術會同時預測並驗證多個 token,以降低大型語言模型的推論延遲,同時維持輸出品質。