研究與評測
METR 報告指 AI 大幅加速 2026 資安漏洞發現,多校聯合推出 SPADE 自對弈訓練框架
Import AI單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Import AI 報導,METR 發布最新研究評估 AI 在不同科學領域的加速效應,指出 2026 年的進展呈現領域差異。在網路安全方面,cURL、OpenSSL、Firefox、Microsoft 及 NVD 等資料庫的漏洞通報率較 2025 年大幅加速;數學研究呈現微幅加速,部分領域 arXiv 提交量在 12 個月內翻倍,並解決了 Smale 名單的 Jacobian 猜想與 Green 名單第 44 號問題等難題;但在 AI 研究最佳化方面(涵蓋 CIFAR-10、Hutter 壓縮、Gurobi、MIPLIB、nanoGPT、Stockfish 與矩陣乘法指數等 7 個領域)則無顯著加速。
同篇報導指出,華盛頓大學、史丹佛大學與 MIT 等多所機構聯合推出 SPADE(Self-Play in Adaptive Synthetic Executable Environments)框架,透過自對弈生成合成訓練環境。該框架讓 LLM 輪替扮演「環境設計者」(編寫可執行的訓練環境程式碼)與「推論代理」,並利用有無特權提示(privileged hints)的表現落差來計算獎勵。研究團隊使用 GRPO 微調 Qwen3 系列模型,結果顯示 Qwen3-30B-A3B-Instruct-2507 表現最佳,在遊戲環境基準測試中平均達到 58.3 分,較基礎模型提升 8.1 分,較最強的固定環境基準提升 5.3 分,且在工具使用環境中亦有顯著效能提升。
讀原始報導背景
語言代理程式(Language agents)的持續自我改進通常受限於固定的訓練環境與目標分佈。為了解決此問題,研究人員提出基於自我對弈的強化學習(RL)框架 SPADE。與過去僅針對單一領域的方法不同,SPADE 能產生多樣且具適應性的合成環境,並在數學、程式碼或工具使用等領域中皆展現出效能提升。