SGLang v0.5.16強化推論
SGLang v0.5.16 上線,加入信心驅動的 DSpark 推測解碼,並支援具 975B 參數、1M token context 的多模態 MoE 模型 Inkling。
22 則值得知道的變化
SGLang v0.5.16 上線,加入信心驅動的 DSpark 推測解碼,並支援具 975B 參數、1M token context 的多模態 MoE 模型 Inkling。
輝達與南韓SK集團宣布規模逾5,000億美元的AI合作計畫,將與SK海力士建立長期關係,確保次世代記憶體供應,並共同開發用於AI訓練、AI Agent及Physical AI的高頻寬記憶體。
Anthropic 出資成立的 Ode 於 7 月 15 日正式亮相,OpenAI、AWS 與微軟也相繼成立前進部署團隊,協助企業把 AI 接入核心業務流程。相關布局規模龐大,包括 AWS 投入 10 億美元、微軟投入 25 億美元並動員約 6,000 名工程師,OpenAI 的合資公司整體規模則上看 100 億美元。
開發者在約 8 美元的 ESP32-S3 上離線執行 2,890 萬參數語言模型,端到端速度約為 9.5 tok/s,並公開韌體、訓練、量化與實驗程式碼。模型運用源自 Gemma 的 Per-Layer Embeddings,將其中 2,500 萬個參數留在 flash 查詢表,使 4-bit 模型以 14.9MB 容量部署於微控制器。
據量子位報導,Vivix發布即時互動多模態模型A1與W1,以原生流式架構支援持續音訊、影片生成及即時介入。Vivix稱,近30B活化參數的A1可在消費級GPU即時推論,平均可見反應延遲低於0.6秒,單卡吞吐量超過10000 video tokens/s。相關效能目前主要來自Vivix技術資料,產品已開放測試申請。
Ollama v0.32.4 透過 MLX engine 支援 Apple GPU 的 Laguna,並依指定類型量化 speculative decoding 的 draft-model 輸出層。
ChatGPT、Codex 與部分 OpenAI 服務一度出現錯誤率升高,官方已採取緩解措施。OpenAI 狀態頁顯示,所有受影響服務已於 2026 年 7 月 25 日上午 11:08 完全恢復。
官方表示,昨晚約凌晨2時至4時發生近乎全球性的服務中斷,目前已完全恢復。團隊已重設所有 Codex 與 ChatGPT Work 使用者的用量上限,並表示將從事故中學習。轉述貼文則稱重設範圍涵蓋所有 ChatGPT 與 Codex 使用者,範圍較官方說法更廣。
據報導,AMD 與施耐德電機共同發布 Helios AI Factory 參考設計,單一機櫃最高支援 246 kW,並可透過模組化架構擴充至 10.4 MW AI 叢集。
據 TechCrunch 報導,華府外一條輸電線本週故障後,PJM 轄區資料中心在約 30 秒內同步移除約 3.1 GW 負載,使電網一度多出 3.49 GW 電力,約 11 分鐘才恢復穩定。事件未造成停電,但導致區域燈光閃爍,顯示高度集中的 AI 資料中心若同時切換備援電力,可能放大供需與電壓波動。
據單一來源貼文,Fly.io 表示已取得新一輪資金,將推出新版 Sprites,並由 Scott Johnston 接任 CEO。公司將策略重心轉向為 AI coding agents 提供半可拋式雲端運算環境,回應代理程式不適合長期綁定傳統公有雲伺服器的需求。相關融資與策略調整目前尚無其他來源佐證。
據單一來源消息,Cloudflare 將向所有客戶推出 Search、Agent 與 Training 三類 AI 流量控制,Free 方案亦可使用。自 2026 年 9 月 15 日起,新加入 Cloudflare 的網域中,顯示廣告的頁面將預設封鎖 Training 與 Agent,Search 則維持允許。