研究與評測
Google 提出 ToolGrad 工具使用資料生成框架:採「先給答案」範式,微調 Gemma-3-12B 跑分達 83.1 超越 GPT-5
Google Research一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Google Research 提出 ToolGrad,這是一個用於生成工具使用(tool-use)資料集的框架,將於 ACL 2026 發表。有別於傳統先生成使用者指令再搜尋解決方案的方法,ToolGrad 採用「先給答案(answer-first)」範式,先生成正確的工具使用鏈,再標註對應的使用者提示,只需一次 LLM 步驟即可完成。
該框架借鑒 TextGrad 的「文本梯度(textual gradients)」概念,透過四個核心模組迭代構建 API 工作流:由 API Proposer 篩選候選 API,API Executors 平行測試並生成報告,API Selector 選擇最佳 API 呼叫作為文本梯度提供方向性回饋,最後由 LLM Updater 修改合成的使用者查詢與 AI 回應。
研究團隊使用 ToolBench 的 1.6 萬個真實 API,並透過 gemini-2.5-flash-lite 生成 ToolGrad-500 資料集,藉此微調 Gemma-3 模型(1B、4B、12B)。在 Berkeley Function Calling Leaderboard (BFCL) 評測中,ToolGrad-12B 獲得 83.1 分,超越 gpt-5(74.4)與 claude-4.5 Opus(82.8),逼近 gemini-2.5-pro(83.2)。此外,該模型表現超越了生成訓練資料的教師模型,並領先 ToolACE 與 Hammer-2.1-7B 等開源工具專用模型。
讀原始報導