Qwen 發表 Qwen3.8-Flash-Next 125B MoE 架構:訓練 FLOPs 降至 1/9,結合 Gated DeltaNet 與稀疏注意力
該模型總參數 125B,每 token 僅啟動 6B,並將 51B 的 n-gram 嵌入表置於加速器外,以極低算力成本達成超越前代的預訓練效能。
68 則值得知道的變化
該模型總參數 125B,每 token 僅啟動 6B,並將 51B 的 n-gram 嵌入表置於加速器外,以極低算力成本達成超越前代的預訓練效能。
HEIR 底層依賴 LLVM,開發者可用 Python 標註加密資料並編譯,目前轉換 PyTorch 模型仍需手動匯出為 MLIR 格式。
VAT 透過在訓練時模擬循序驗證並動態調整損失權重,無需修改模型架構即可疊加於現有方法,優化大型語言模型推理效率。
透過 SSD 串流載入權重,該 Swift 工具最低支援 8GB 記憶體運行 125B 模型,並原生相容 OpenAI 與 Ollama API。
Noetra 與 NVIDIA 將建置 140MW 的 Vera Rubin AI 工廠,助日本將龐大工業設備基礎轉型為通用控制平台。
交易含 34 億美元現金與承接 7 億債務,預計 2027 年上半年完成。SLB 預估合併後,2028 年資料中心業務營收將達 45 至 50 億美元。
因應 AI 算力需求,台積電宣布半導體微縮轉向系統整合,預告 A16 SoIC 於 2029 年量產,並將研發晶片背面微通道液冷技術以解決散熱瓶頸。
三星揭露新一代 3D 記憶體架構,將記憶體直接堆疊於處理器上以降低延遲,並宣布已出貨業界首款 12 層 HBM4E 樣品。
該工具可追蹤系統變更並推斷連鎖反應,充當自主基礎設施工程師,目前已獲 S&P Global 等財星 500 大企業採用。
根據 IPO 文件,這家由軟銀集團支持的資料中心公司,其 8.8GW 容量主要分布於德州與俄亥俄州,處於已簽約或建設階段。