跳到主要內容
2026-09-30 日報
模型發布

智源 27B 多模態代理模型 AREX-2 上架 Hugging Face,MLE-Lite 評測達 81.8 分超越 GPT-5.6 Sol

HF @BAAI一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

智源研究院(BAAI)的 27B 參數長視野代理模型 AREX-2 已上架 Hugging Face。該模型為相容 Qwen3.8 的密集型多模態架構,支援高達 262,144 tokens 的上下文長度。 AREX-2 主打長視野自我改進能力,能透過讀取分數、日誌、錯誤訊息與時間進行回饋驅動反思,在多個測試時間輪次中(提出、測量、反思、修改)持續優化解決方案。模型使用具備可驗證回饋的機器學習與演算法程式設計任務,結合現有的 AREX 深度研究資料進行訓練,使其跨領域效能獲得提升。 在官方公布的評測中,AREX-2 於 MLE-Lite 取得 81.8 分,超越 GPT-5.6 Sol(72.7 分)與 Naive-N0.5-Flash(73.7 分);在包含 188 項任務的 Frontier-CS 代理軌道中取得 70.7 分,優於 Gemini-3.1-Pro(68.9 分)與 DeepSeek-V4-Pro(44.7 分),僅次於 GPT-5.5 以上版本及 Claude Opus 4.8。官方頁面已提供使用 Transformers、vLLM、SGLang 及 Docker 的具體程式碼與部署範例。
讀原始報導