OpenAI 首款自研推論晶片 Jalapeño 跑分出爐:採台積電 3nm,每瓦吞吐量最高達 NVIDIA GB200 的 1.9 倍
該 ASIC 晶片與 Broadcom 合作開發,專為大語言模型推論設計且僅供內部使用,實測打破傳統硬體限制,同時實現高吞吐量與極低延遲。
69 則值得知道的變化
該 ASIC 晶片與 Broadcom 合作開發,專為大語言模型推論設計且僅供內部使用,實測打破傳統硬體限制,同時實現高吞吐量與極低延遲。
機櫃搭載 256 顆 LPU 專攻低延遲推論;SpaceXAI 則計畫將 NVL72 系統送上太空,應用於 Starmind 衛星。
新款 Mac Studio 台灣起售價 84,900 元,首度支援 Thunderbolt 5 叢集串聯多台設備共享記憶體池,頂規 512GB 版本預計 10 月下旬推出。
新工具允許 AI 代理從 Grafana 提取指標與日誌,並根據實際系統行為建立測試與儀表板,解決開發者盲目合併 AI 生成程式碼的風險。
隨 CUDA 13.3 推出,核心組件 cuda.core 讓不同 Python 函式庫能直接共用 GPU 緩衝區與串流,無需複製資料。
M6 為 Apple 首款 2nm Mac 晶片。受惠於 macOS 26.2 支援 Thunderbolt 5,開發者可串聯多台 Mac 透過 MLX 框架執行大型語言模型分散式推論。
透過 GPU Memory Service 讓備用引擎與主引擎共享記憶體權重,實測將 GLM-5.2 的冷啟動時間從 283 秒降至 7.3 秒,並已支援 vLLM 等推理框架。
此 v2 搶先體驗版顛覆傳統 SaaS 模式,讓使用者在獨立沙盒中透過 AI 代理生成並修改專屬應用程式,避免資料外洩風險。
該開源底座旨在實現演算法跨機型零成本複用,目前已累積逾 60 萬行程式碼,官方並提供免費算力 Token 與遠端硬體除錯資源吸引開發者。
系統結合關鍵字與語意搜尋,利用 HF Inference Endpoints 即時推論,並以 NVIDIA L4 批次生成嵌入,同時驅動相關論文推薦功能。