跳到主要內容
2026-09-12 日報
開發生態

Together AI 微調服務升級:支援 GLM-5.3 等新模型,新增 Expert LoRA 控制並降價最高 70%

Together AI一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Together AI 宣布擴展其微調(Fine-Tuning)服務,新增多款開源權重模型支援,包含 GLM-5.1 至 5.3 系列、DeepSeek-V4-Flash 變體、Kimi K2.6 與 K2.7-Code、Qwen 3.5 至 3.8 系列,以及 Gemma 4 變體。官方指出,其中 GLM-5.3 在 Terminal-Bench 2.1 評測中獲得 88.2 分。 在實驗追蹤方面,微調任務現在會在每個訓練與評估步驟記錄損失(loss)、梯度範數與學習率。開發者可透過 API、CLI 或 UI 儀表板即時查看數據,並在同一圖表中比較多個執行中的任務曲線。 針對訓練控制,Together AI 針對混合專家(MoE)模型推出 Expert LoRA 功能。傳統 LoRA 僅微調注意力層,新功能允許將適配器(adapters)應用於專家層。官方測試顯示,在教導模型 200 個虛構事實時,包含專家層的適配器能將新知識回憶率從 15% 提升至 89%,並在 MMLU-Pro 評測中以 75.3% 勝過僅微調注意力層的 71.5%。 此外,系統加入提早停止(Early stopping)機制,當驗證損失觸頂平緩時會自動終止訓練,保留最佳檢查點並自動退還未使用的訓練步驟費用。針對大型模型或長序列,現可透過設定梯度累積步驟(gradient accumulation steps)來支援超出單一 GPU 記憶體限制的任意批次大小(batch size)。 官方同時宣布調降多數支援模型的微調價格,降幅從 30% 起跳,部分模型(如 gpt-oss 系列)最高可達 70%。
讀原始報導

背景

開放權重(Open-weight)模型是指將訓練好的人工智慧模型的學習參數(主要是權重與偏差值)公開發布。這項作法允許開發者下載並使用該模型,進而對其進行修改或微調。

來源