研究與評測
Google 提出 RRSI 方法防止 AI 代理自我改進過度擬合,未見任務提升達 4.7 分並減少 30% Token 消耗
The Decoder單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Google Cloud AI Research 與多所大學研究人員提出 RRSI(Regularized Recursive Self-Improvement)方法,旨在防止 AI 代理在自我改進過程中過度擬合測試任務,並同時降低運算成本。相關程式碼已在 GitHub 開源。
現代 AI 代理依賴包含提示詞、工作流、工具與邏輯的 Harness 框架來控制凍結的語言模型。當系統透過語言模型自動重寫 Harness 進行自我最佳化時,常會記住特定基準測試的模式或硬編碼解決方案,導致在未見過的任務上效能停滯或下降。
RRSI 透過兩項機制限制最佳化循環:首先,設定隨時間遞減的編輯預算,初期允許大幅重寫,後期僅限可追蹤結果的小幅修改,並追蹤失敗嘗試以避免重複;其次,引入審查機制(critic)剔除硬編碼任務名稱或特定基準技巧的提案,要求增加運算成本的修改必須帶來可衡量的效能提升,並移除無用組件。
在涵蓋程式碼、辦公室任務與工程設計等 8 個基準測試中(底層模型使用 Claude Opus 4.8),RRSI 在訓練任務上提升達 14.1 分,在 5 個未見過的基準測試上提升達 4.7 分(JobBench),且執行時 Token 消耗較未正則化版本減少約 30%。與其他四種最佳化方法相比,RRSI 在訓練任務的增益最小,卻是唯一在未見任務上表現遠高於基準線的方法。
此外,該方法具備跨模型泛化能力。以 Gemini 3.5 Flash 最佳化的程式碼 Harness,在不作任何修改的情況下,能讓較弱的 Gemini 3.1 Flash Lite 準確率從 11.2 分提升至 14.6 分。研究團隊指出,此研究僅針對凍結模型,不涉及模型權重的更改。
讀原始報導背景
AI 代理(AI agent)的運作依賴名為「harness」的軟體基礎設施,負責管理大型語言模型的工具呼叫、記憶體與執行環境。近期領域內積極探索遞迴自我改善(Recursive self-improvement),嘗試讓 AI 系統透過重寫自身程式碼來不斷提升能力。