跳到主要內容
2026-10-07 日報
研究與評測

程式碼代理基準測試 SWE-Race 發布:收錄 188 個真實 Python 併發漏洞,GLM-5.3 Flash 實測達 85%

Reddit r/MachineLearning單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息,開發者發布了針對程式碼代理(coding agent)的新基準測試 SWE-Race,專注於評估模型修復真實併發漏洞(如競爭條件、死結、取消問題)的能力。該資料集包含來自約 100 個 Python 專案已合併 PR 的 188 個真實漏洞,其中一半為不公開任務。 為防止模型作弊,測試在無網路的容器環境中運行,且儲存庫被縮減至單一提交紀錄,使代理無法從 git 歷史中還原修復程式碼;評估標準則採用專案原有的測試案例,並遵循 DeepSWE 協議(100 步)。 實測數據顯示,在單次嘗試下,GLM-5.3 Flash 獲得 85% 的分數;若進行兩到三次嘗試,其分數為 82%,與 GPT-5.6 Luna 的 81% 落在誤差範圍內。任務難度呈現兩極化:約一半的任務對所有模型都很簡單(接近 100% 成功率),而另一半困難任務的得分則落在 50%、45% 與 23%,模型間的能力差異主要來自困難任務。 開發團隊審查了代理執行的 1.1 萬條指令,發現有 69 次嘗試存取網路但皆失敗,其中 GLM 曾嘗試 50 次使用 `pip download` 下載它正在修復的函式庫的已修復版本。在資料污染檢查方面,2026 年以前的舊漏洞解決率約高出 9 個百分點,但因信賴區間跨越零,目前尚無法得出確切結論;公開與私有任務的得分目前在三個受測模型中表現一致。
讀原始報導