跳到主要內容
2026-10-07 日報
研究與評測

由 AI 開發的開源 AI 加速器 OpenTPU 發布,在 FPGA 實測十款模型且 DRAM 利用率達 94%

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

由 AI 開發的開源 AI 加速器專案 OpenTPU 正式發布,旨在探索 AI 代理在硬體設計領域的能力。該專案提供完整的開源堆疊,包含硬體設計(SystemVerilog)、指令集、位元精確模擬器、核心語言編譯器以及驅動真實 PCIe 卡的主機軟體。 實測在 Inspur YPCB-00338 卡(配備 Xilinx Kintex-7 xc7k480t 與雙 DDR3 通道)上成功運行十款模型,且硬體輸出與模擬器達到位元級一致。在 4-bit 量化與 int8 head 設定下,LFM2.5-230M 裝置端解碼速度達 85.8 tok/s(預填 335.4 tok/s);Gemma 4 E2B 達 12.14 tok/s;3.8B 參數的 Phi-4-mini 達 6.56 tok/s。 系統主頻為 133.33 MHz,採用由記憶體核心內建小型 CPU 校準的 LiteDRAM 控制器。最新版本(Build B)將 DRAM 峰值頻寬利用率從 82-87% 提升至 91-94%(最高達 16.1 GB/s),使 LFM2-2.6B、SmolLM3 與 Phi-4-mini 等模型的解碼速度提升 8% 至 10%。 針對超過卡載 4 GiB 記憶體限制的混合專家(MoE)模型,OpenTPU 支援從主機儲存動態串流專家權重至卡上 DRAM 的專屬插槽。實測 8.5B 參數的 LFM2.5-8B-A1B 模型,專家權重命中率達 98.5%,解碼速度可達 10.6 tok/s。
讀原始報導

背景

OpenTPU 的開發借鑑了「auto-arch-tournament」專案,該專案是一個針對 SystemVerilog RV32IM CPU 的自主研究迴圈,讓 AI 代理持續提出微架構假設。其硬體設計所使用的 SystemVerilog 是一種標準化(IEEE 1800)的硬體描述與驗證語言,廣泛應用於半導體產業的晶片建模與設計。

社群討論

社群對 AI 開發出能在約 300 美元 FPGA 上運行,並透過自我改進將小型模型效能提升至 80+ tok/sec 的推論引擎給予肯定。有開發者檢視 RTL 發現其浮點運算不精確,但也印證了 LLM 的容錯率;同時,部分網友質疑這仍高度依賴人類提示與建立模擬環境。針對將模型直接燒錄成 ASIC 的討論,專家指出模型迭代過快、MoE 參數過大以及單一 FPGA 容量不足等現實技術與成本限制。

來源