研究與評測
NVIDIA 推出 SWE-Serve 評測基準:實測顯示加入即時服務驗證後,AI 代理程式碼通過率從 69.4% 降至 45.9%
NVIDIA Developer一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

NVIDIA 推出針對 AI 程式碼代理的評測基準 SWE-Serve,旨在測試推論服務(inference-serving)堆疊的真實部署能力。該基準與 SGLang 團隊合作,將 83 個合併的 SGLang Pull Request 轉化為 53 個可執行的任務,涵蓋解碼、模型啟用、核心、API、快取與排程等 6 大類。硬體配置上,12 個任務在 CPU 運行,41 個使用單張 NVIDIA H100;目前首發版本不評估其他推論引擎、多 GPU 或多節點服務。
實測發現本地測試與實際部署存在顯著落差:在 19 個包含即時服務(live-serving)檢查的任務中,若排除這些檢查,代理生成的修補程式(patch)通過率為 69.4%;但加入完整驗證器後,通過率降至 45.9%,約三分之一通過其他測試的修補程式在即時服務測試中失敗。此外,任務難度隨領域跨度增加,單一執行階段領域的任務通過率為 69.0%,跨多個領域的任務通過率則降至 47.7%。
官方使用 mini-swe-agent 測試了包含 Claude 與 GPT-5.6 在內的 11 款模型,最佳配置的 pass@1 介於 34.6% 到 75.5% 之間,且沒有單一模型在所有任務類別中皆取得最高分。
讀原始報導