模型發布
Transformers v5.15.0 發布:支援 Meta 30B 多模態模型 Muse Glimmer 及多項破壞性變更
GitHub huggingface/transformers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
Hugging Face 發布 Transformers v5.15.0,重點新增對 Meta 最新開源多模態模型 Muse Glimmer 的支援。Muse Glimmer 採 Apache 2.0 授權,從 Muse 蒸餾至 30B 參數(包含 2B ViT 視覺編碼器與 28B 文本解碼器),專為程式碼編寫、文件分析等 AI 代理任務設計。此外,新版亦加入對 GraniteMoeSWA、GraniteSWA、A.X-K1、A.X-K2 及 Cosmos3 Edge 等模型的支援。
本次更新包含多項破壞性變更:線性注意力模型(如 Mamba)的核心運算改為手動啟用(opt-in);快取裁剪(cache cropping)API 僅接受負值作為相對偏移量;T5 系列模型全面支援 SDPA 等注意力後端,預設實作可能改變,依賴舊版者需手動設定 `attn_implementation="eager"`;同時移除了多模態處理器中的部分私有輔助函數。
在效能與生成最佳化方面,新版新增 Qwen2.5/3-Omni 的批次音訊生成支援,允許滑動視窗快取層用於投機解碼,並透過消除多餘的張量複製,加速 GLM4V 等視覺語言模型的影像前處理。此外,更新修正了 MLA 快取壓縮問題,並解決 `generate()` 呼叫中靜態快取持久化造成的記憶體開銷。
讀原始報導背景
本次 `transformers` 更新涉及 Mamba 等線性注意力(linear attention)模型的底層核心(Kernels)呼叫方式調整。Mamba 是一種挑戰 Transformer 的新型架構,其 3B 參數模型在語言建模的表現不僅超越同等規模的 Transformer,更能媲美兩倍大的模型。