跳到主要內容
2026-08-27 日報
模型發布

Transformers 發布 v5.16 雙版本:支援 Qwen4-Exp、GLM-5.3-Flash 與 Step-3.7-Flash

GitHub huggingface/transformers綜合 2 家報導一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Hugging Face 於 GitHub 發布 Transformers v5.16.0 與 v5.16.1 版本,重點新增多款大型語言與多模態模型支援,並引入重大架構變更。 在模型支援方面,v5.16.0 新增 Qwen4-Exp,該模型採用混合文本與多模態架構,首度結合線性與稀疏注意力機制(QSA),並引入 GatedResidual 與單層嵌入(PLE)技術,大幅提升長文本推論效率。v5.16.1 則特別加入 GLM-5 系列首款原生多模態模型 GLM-5.3-Flash,其總參數達 3200 億(啟動參數 180 億),同樣採用稀疏與線性注意力混合架構,官方稱其在程式碼與代理評測逼近 Claude Opus 4.8,且效能超越 GLM-5.2 但成本僅需十分之一。 視覺與語言模型部分,新增支援 StepFun 推出的 1980 億參數稀疏 MoE 視覺語言模型 Step-3.7-Flash,結合 1960 億參數語言骨幹與 18 億參數視覺編碼器,具備 288 個路由專家(每 token 啟動 8 個)、動態影像切片與多 token 預測(推測解碼)功能;同時納入 Cohere 的小型模型基礎架構 CohereCompass。 語音與生物學模型方面,新增 IBM 的 4.7 億參數語音辨識模型 GraniteSpeech5,採用純編碼器架構與 CTC 解碼;以及 BioHub 的蛋白質語言模型 ESMC(涵蓋 3 億至 60 億參數)與採用迭代擴散技術的蛋白質摺疊模型 ESMFold2。 在重大變更(Breaking changes)部分,舊版張量平行(TP)實作已全面替換為 DTensor 原生後端,用戶須轉移至新介面進行推論或訓練;`attn_implementation="sdpa"` 現已正式支援 wav2vec2_conformer、wav2vec2-bert 與 SeamlessM4T/v2 模型;`FuyuProcessor` 則不再回傳 `image_patch_indices` 輸出。
讀原始報導

背景

Gated DeltaNet 是一種能超越 Mamba2 等現有模型的新架構,在語言建模與推理任務上具備優異的訓練吞吐量表現。CTC(Connectionist temporal classification)則是一種損失函數與輸出表示法,專門用於語音辨識等輸入與輸出未在時間上對齊的序列標記任務。

來源