跳到主要內容
2026-10-03 日報
研究與評測

Meta 等機構研究員發布 SWE-sweep 基準測試,評估 AI 主動發現並修復程式碼漏洞的能力

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit r/LocalLLaMA 貼文指出,來自 Meta、史丹佛大學、哈佛大學與華盛頓大學的研究人員發布了名為 SWE-sweep 的新基準測試。有別於現有測試多要求模型修復使用者已遇到的已知錯誤,SWE-sweep 旨在評估 AI 代理在無人為介入下,主動掃描程式碼庫並找出漏洞的能力。 測試方式是將完整的程式碼庫交給 AI 代理,並根據預先隱藏的真實世界漏洞集進行評分;所有漏洞皆經過篩選,確保僅透過閱讀程式碼庫即可發現與修復。研究人員表示,目前模型的測試得分遠低於預期,即使在小型專案中表現也未達水準。在成本效益方面,目前排行榜上以 Luna xhigh 表現最佳。該專案採 MIT 授權開源,相關程式碼與論文已發布於 GitHub 與專案網站。
讀原始報導
相關主題