Cerebras 發布 CS-4 機櫃級 AI 推論系統:搭載 3 顆 WSE-3 Turbo,號稱較 GPU 快 30 倍
新系統採用台積電 5 奈米製程,預計第三季上市。其模組化設計使零組件減少 50%,晶片間延遲降至 2 微秒,能在十兆參數模型上實現每秒破千 token 的生成速度。
63 則值得知道的變化
新系統採用台積電 5 奈米製程,預計第三季上市。其模組化設計使零組件減少 50%,晶片間延遲降至 2 微秒,能在十兆參數模型上實現每秒破千 token 的生成速度。
該模型專為長時間運行的 AI 代理與視覺任務打造,提供四段可調推理強度,輸出定價為每百萬 Token 6 美元。
該漏洞源於未經驗證的 webhook API,攻擊者可藉此存取雲端中繼資料;資安公司已偵測到大規模掃描,呼籲開發者儘速更新至 3.15.0 版。
結合 Inco 發布的專用草稿模型,實測不僅生成速度翻倍,更在 RTX 3090 上將長對話後續輪次延遲從 23 秒降至 1 秒。
演講稱 SqueezeLLM 解決了 2-bit 分組量化難題,惟補充資料顯示該技術實為 Sehoon Kim 等人發表於 ICML 2024。
據實測,V100 透過自研核心即時轉換權重至 FP16,達成 219.1 tok/s 吞吐量,現已支援直接載入官方混合權重。
由 Spring 創始人共同打造,開發者只需宣告目標與動作即可自動推斷執行順序,並支援為單一動作指定不同模型以最佳化成本。
隨著 AI 代理需要複雜的工具呼叫與資料路由,微軟 Azure Cobalt 200 將部署至逾 25 個資料中心,AWS Graviton5 採用率亦翻倍,確立 Arm 架構在 AI 基建的核心地位。
該軟硬一體化方案包含 AperEgo 採集硬體與 AperOS 平台,可於端側直接剔除無效數據,官方稱生產效率較傳統遙操作提升 10 倍以上。
本次更新涵蓋 72 項漏洞,Gaudi 容器執行環境需升級至 1.24.0 修補,而 Intel Extension for PyTorch 等 4 款已停止支援的 AI 軟體因無修補程式,官方建議直接移除。
空芯光纖透過真空腔傳輸光訊號,將每公里延遲降至 3.5 微秒,並獲匿名雲端大廠 4000 萬美元訂單,解決 AI 算力跨廠區部署限制。
開發者解析暫存器格式建立開源執行環境,支援從 PyTorch、ONNX 與 JAX 運行 SigLIP 模型,完全免除對官方 SDK 的依賴。
採 MIT 授權,透過延遲載入 MCP 工具與自動壓縮對話來最佳化上下文管理,並可與其付費的 AI Gateway 企業服務整合。