跳到主要內容
2026-09-22 日報
研究與評測

GAISS 2026 研究指出:規範驅動開發未提升 AI 程式碼 Bug 發現率,但使人類審查歸因率達 81%

AI 前線單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,一項被 GAISS 2026 收錄的研究針對 AI 生成程式碼的驗證與治理提出「規範驅動開發」方法論,探討人類與模型在程式碼審查中的表現。隨著 EU AI Act、ISO/IEC 42001 及 NIST AI 風險管理框架陸續落地,AI 程式碼的治理瓶頸已從生成轉向驗證與究責。該研究將規範分為業務需求、高階設計(HLD)與低階設計(LLD)三層,作為審查 AI 生成程式碼的基準契約。實驗以包含 20 個不變量(invariants)的多帳戶銀行服務 API 為測試對象,由 5 名具 3 至 10 年經驗的審查員進行 2×2 交叉實驗。結果顯示,提供規範基準並未提升 Bug 發現的召回率(有基準為 0.525,僅看程式碼為 0.518,p=0.69);但歸因率從 0% 大幅提升至 81%(p=0.043),使審查者能將問題明確對應至已批准的條款。研究另使用 Claude Opus 4.8、GPT-5.2、DeepSeek V4 與 Gemini 3.1 進行 90 次自動化審查復現實驗,結果呈現相同趨勢:召回率無顯著變化(0.51 對 0.49),但歸因率在無基準時從 0.67 降至 0。該研究指出,規範基準的價值不在於發現更多錯誤,而是建立可追溯的審計軌跡,確保最終責任由人類承擔。
讀原始報導