阿里發布 Qwen3.8-Flash-Next 176B 模型權重,NVIDIA 宣布 GB300 NVL72 提供 Day-0 支援
作為 Qwen4 架構預覽,此多模態 MoE 模型每次啟動 6B 參數,透過混合架構消除 KV Cache 增長,百萬上下文預填裝吞吐量達前代 8.6 倍。
64 則值得知道的變化
作為 Qwen4 架構預覽,此多模態 MoE 模型每次啟動 6B 參數,透過混合架構消除 KV Cache 增長,百萬上下文預填裝吞吐量達前代 8.6 倍。
新版只需單一開關設定,即可將 Ollama 設為第三方閘道器,讓雲端與本地端模型在 Claude Desktop 中順暢運行。
新版為 2.8T 參數的 Kimi-K3 導入共享專家分片,每張 GPU 可省 17 GiB 記憶體,並將最大批次 token 預設值升至 16384。
新版同步納入 BioHub 蛋白質摺疊模型 ESMFold2,並將舊版張量平行處理全面替換為 DTensor 原生後端。
受惠於 AI 生態系公允價值增長,商湯上半年營收達 29.11 億人民幣並首度扭虧為盈,期內日均 Token 服務量達 2.4 兆。
該預覽版以 MIT 授權釋出,建構於 Cordis 元框架之上,將模型適配器與工具註冊表等元件拆分為獨立外掛,並內建事件日誌子系統以利追蹤除錯。
新技術將記憶體控制器整合至 HBM 基礎晶粒,較標準 HBM4E 降低 15% 功耗並釋放 25% 運算面積,將由多家供應商提供。
協議為期 6 年,算力將來自 Nscale 位於西維吉尼亞州的資料中心,預計 2027 年底上線,為其近期密集的巨額算力擴張再添一筆。
該架構針對工具呼叫與推理設計,單機架最多整合 8160 顆核心,Arm 將 2027 至 2028 年相關需求預估上調至 20 億美元。
超大型資料中心散熱設備已佔 ebm-papst 三分之一營收,此併購案將助其打開美國市場,總部則維持在德國穆芬根。
Lambda 指出設備折舊為算力最大成本,利用率減半將使折舊翻倍;前沿模型依賴高速互聯集群,使算力難以成為標準化商品。
鴻海透過子公司 Q-Edge 取得廠房,提前擴充伺服器機櫃與液冷產能,預期 NVIDIA GB 系列機櫃需求將延續至 2027 年。
協議涵蓋 Blackwell Ultra 與 Rubin 等次世代晶片,預計於 2027 至 2028 年部署,規模達五個月前首批百萬顆訂單的三倍,總價值估計達數百億美元。
MiniMax 於業績會指出將擴大強化學習訓練並推進國產晶片適配;其上半年營收達 1.17 億美元,年增逾 2.8 倍,虧損微幅收斂。
該公司專注開發大模型智能路由與調度底座,其開源代理 OpenSquilla 內建自研路由能力,並計畫發展 Agent-Native 模型。
據報導,新架構捨棄傳統單一網格,改採模組化運算區塊,提供 1.6 TB/s 記憶體頻寬與 128 條 PCIe 6.0 通道。
該提案將允許各州核發許可而無需公告,14 州檢察長連署反對此舉為加速 AI 基礎設施而犧牲透明度,新制預計一年內生效。