NVIDIA 推出 CUDA Rust:GPU 核心可原生編譯至 PTX,提供 SIMT 與 Tile 雙開發路徑
開發者現可在單一檔案撰寫主機與裝置端程式碼,無需獨立的 kernel crate。其 SIMT 路徑專案 cuda-oxide 需搭配 Linux 與運算能力 8.0 以上 GPU 使用。
79 則值得知道的變化
開發者現可在單一檔案撰寫主機與裝置端程式碼,無需獨立的 kernel crate。其 SIMT 路徑專案 cuda-oxide 需搭配 Linux 與運算能力 8.0 以上 GPU 使用。
每幾百張 GPU 即有一張出現靜默資料損壞,且機架匯流排螺絲鬆動曾引發韌體限電,導致叢集中 5% 的 GPU 效能低落。
演講指出算力衡量正從生成 token 轉向任務完成度,未來十萬顆 GPU 將透過極低抖動網路同步運轉,支撐代理與實體 AI 發展。
專案 Deltafin 堅持不壓縮 1.45 TB 的專家權重,利用小模型推測解碼提升速度。實測 512 token 提示詞的首字延遲達 6.3 分鐘,硬碟讀取最慢節點為效能瓶頸。
實測顯示 llama.cpp 啟動僅需 16 秒最快,且其 MTP 分支提升解碼速度約 1.6 倍;各引擎在數學跑分上無顯著差異。
該架構採用專用有狀態推論機制,支援會話上下文即時遷移,並在上線前透過導入真實流量的靜默測試,排除跨機房部署等延遲異常。
該系統預先整合 CPU 核心與記憶體,相較前代單插槽效能最高翻倍。Arm 同時宣布與新紫光集團在中國成立聯合 AGI 創新中心。
針對 AI 代理常請求廣泛權限的問題,開發者現可透過 optional_scopes 陣列標記可選權限,讓用戶在授權介面取消勾選單一項目,打破全有或全無的限制。
雙方將採用高通 SerDes 與光學 DSP 技術打造 AI 推論基礎設施,高通亦將擴大使用 Amazon Bedrock 服務以縮短晶片設計週期。
算力需求帶動全球光纖稼動率衝上 92% 高點,訂單能見度達 2027 年首季;市場定價錨點首次由電信循環轉為 AI 戰略資源。
專為 CUDA 裝置設計,實測長語音提示下無效能衰退。展示於 Jetson Orin 設備運行語音對話,並支援唇形同步與手勢功能。