研究與評測
JIT-Agent 模型發布:為 LLM 動態生成自適應 Agent 框架,助 DeepSeek-V4-Flash 跑分超越 GPT-5.6
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
JIT-Agent 是一個可訓練模型,能為現成的 LLM 即時生成自適應的 Agent 框架(harness)。該研究將 Agent 框架定義為由記憶體管理、規劃策略、行動協定與工具編排組成的固定四模組協定,使其成為可由機器生成的組件。
JIT-Agent 能針對當前任務客製化框架、修復框架以確保穩定執行,並透過過往配置的效能訊號進行自我進化。實測顯示,DeepSeek-V4-Flash 在 JIT-Agent 輔助下,於 DeepSearchQA 與 OdysseyBench 評測中分別超越 GPT-5.6 達 9.1 分與 4.3 分;GLM-5.2 亦獲得高達 20.2 分的提升。
此外,JIT-Agent 生成的框架效能媲美 OpenCode 與 Claude Code 等成熟 Agent 運行環境,並能穩定提升 DeepSeek V4、Mimo-V2.5 與 Qwen3.6 等多種規模的模型家族表現。相關專案與資料集已於 GitHub 及 Hugging Face 公開。
讀原始報導背景
AI 代理程式的框架(Agent harness,又稱代理鷹架)是包圍大型語言模型的軟體基礎設施,負責管理工具使用、記憶體、狀態持久性與執行環境,使其能作為 AI 代理運作。而 OdysseyBench 則是一個專為任務導向代理系統設計的綜合基準測試與評估套件。