OpenAI 首款自研推論晶片 Jalapeño 跑分出爐:採台積電 3nm,每瓦吞吐量最高達 NVIDIA GB200 的 1.9 倍
該 ASIC 晶片與 Broadcom 合作開發,專為大語言模型推論設計且僅供內部使用,實測打破傳統硬體限制,同時實現高吞吐量與極低延遲。
69 則值得知道的變化
該 ASIC 晶片與 Broadcom 合作開發,專為大語言模型推論設計且僅供內部使用,實測打破傳統硬體限制,同時實現高吞吐量與極低延遲。
該技術跳過壓縮後的檢查點,直接從原始 120B 模型進行知識蒸餾,使 MXFP4 量化模型不僅體積更小,還能在長文本推理與數學等測試中超越 bfloat16 版本,並支援 32k 詞元。
該框架處理 906 份 Panasonic 文件,分別以 Qwen3-30B-A3B-Instruct 與 Claude-Opus-4.6 建立 1.36 萬筆問答資料集,微調 Qwen3-4B 後準確率最高達 56.4%。
該 27B 參數模型以 1574 分位居總榜第七,輸出定價為每百萬 token 3 美元,成功改變了該領域的性價比前沿。
由 BreezeBlueX 推出的最新開放權重模型支援 50 種語言,並具備從文字提示生成語音的功能,確立其在開源語音生成的領先地位。
針對 12 款模型進行的測試顯示,若前三名搜尋結果遭替換,推薦假商品的機率高達 73.8%,且現有防禦機制皆無法有效防範。
NVIDIA 今日發表 Groq 3 LPX。Gemma 4 支援 256K 上下文,本次實測刷新了該模型在所有端點的輸出速度紀錄。
計畫提供資金、模型存取權與技術支援,成果須完全開源。旨在解決多輪對話中難以評估的心理健康風險,申請於 9 月 21 日截止。
據報導,中科紫東太初旗下 ScienceClaw 升級推出 AutoProject,透過三層架構讓 AI 能自主拆解子任務、修正參數並核驗跨任務邏輯,涵蓋生化物理等多領域。
該分支允許設定推測 token 數的上下限並由引擎自動調整。據稱在 Strix Halo 處理器上生成結構化內容時,速度從 44 t/s 提升至 65 t/s。