開發生態
Anthropic:AI 代理讓 CI 工作量半年增 25 倍,重寫測試影響分析服務
Claude 官方部落格一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Anthropic 在 2026 年 9 月 14 日發布文章表示,隨著 AI 代理參與程式碼撰寫、審查與核准,團隊的 CI 工作量在六個月內增加 25 倍。Anthropic 工程師平均每季交付的程式碼量,是 2021 至 2025 年水準的 8 倍;其中 80% 由 Claude 撰寫,程式碼庫中的測試數量也增加 10 倍,而工程師人數僅小幅增加。
Anthropic 原本以確定性的 test impact analysis 服務決定每個變更要執行哪些測試。服務由「listener」記錄每次 CI 執行結果,再由「selector」讀取測試歷史與套件關聯性,為開啟的 PR 選擇測試。兩者共用單一程序,listener 若落後 PR 佇列,可能造成錯誤變更合併後引發大量無關調查、失敗測試阻擋合併,以及新增或修復的測試未及時執行。
服務最初需要單一寫入者維持每項測試的歷史,因此無法進行橫向分片。去年 10 月服務連續兩天發出告警後,團隊先將執行服務的 CPU 核心數加倍;這項修補僅暫時有效。之後,Claude 生成程式碼,將每個套件的狀態拆成獨立分片與工作者,讓 listener 能按套件維持結果順序,但只維持了 29 天。到了 3 月,程序在多數工作日下午前達到記憶體上限,重新啟動服務只能支撐不到一天。
三次快速修補分別維持約 70 天、29 天及不到一天。Anthropic 也使用內部版本的 Claude Tag 長期監控服務;當 listener 落後超過 50,000 個工作時,Claude 會通知工程師並恢復先前對話。文章指出,最終需要的是重新設計並採用可橫向擴展的測試選擇架構,而非持續依賴加大機器、平行化或重啟服務等短期措施。
讀原始報導背景
代理程式設計(Agentic coding)是指利用大型語言模型與 AI 代理來輔助軟體開發,涵蓋程式碼生成、除錯與測試等環節。而測試影響分析(Test Impact Analysis, TIA)則是一種透過自動選擇測試項目來進行漸進式驗證的技術,僅挑選必要的測試子集來評估程式碼變更的潛在影響。