跳到主要內容
2026-09-05 日報
研究與評測

EEBench 發布 AI 電路設計評測 V1,Claude Opus 5 以 61.6% 登頂排行榜

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,受 OpenAI 展示 GPT-6 Astra 操作 KiCad 電路板設計的啟發,EEBench 團隊推出針對 AI 電路設計能力的評測基準 V1。 團隊指出,讓 AI 代理操作圖形化 CAD 工具會消耗大量上下文在座標與介面狀態上。EEBench 改用 atopile,讓電路以宣告式程式碼呈現,使模型能直接處理元件、連接與電氣限制。 評測任務涵蓋類比與數位設計,並引入真實工程的複雜度。例如在電源中斷或多重回饋低通濾波器設計任務中,模型不能只套用教科書的理想值,必須考量真實製造商零件的規格、公差極端情況(tolerance corners),並在電氣效能、成本與供應鏈之間取得平衡。 評分機制採完全確定性測試,系統會構建設計並執行 SPICE 模擬,測量電壓、增益、漣波與暫態響應等指標,電路運作正常後才會計算成本效益。目前 V1 專注於需求、設計與驗證迴圈,尚未包含佈線(layout)與製造環節。 根據 9 月 1 日的排行榜,Claude Opus 5 在 13 項任務中以 61.6% 的成績位居第一;Grok 4.6 以 57.1% 排名第二,微幅領先 Claude Fable 5.1 的 56.4%。此外,xAI 已將 EEBench 納入 Grok 4.6 的模型卡中作為工程能力的指標,其官方測試顯示 Grok 4.6 在 xhigh 推理模式下取得了 60.0% 的成績。
讀原始報導

社群討論

社群肯定 AI 在初期概念、檢查 BOM 表與生成簡單電路上的實用性,例如有網友僅花 6 美元便成功製造出由 Opus 4.8 設計的 VGA 電路。然而,多數人指出 AI 在實際 PCB 佈線與複雜任務上普遍失敗或過度設計,且受限於硬體訓練資料缺乏與 datasheet 取得困難,難以像軟體界那樣帶來革命。目前的成功多仰賴「AI 處理純文字與除錯,人類負責佈線及手動修復」的協作模式,同時也有人對 EEBench 等基準測試的可靠性提出質疑。

本期分類