跳到主要內容
2026-09-10 日報
模型發布

Transformers 5.17.0 發布:支援 780B MoE 模型 HYV4、KimiLinear 與阿里 Fun-ASR-Nano

GitHub huggingface/transformers一手來源
核實資料不足

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

本次未取得足夠原文證據

HuggingFace Transformers 發布 5.17.0 版本,新增對多個前沿架構模型的支援。 本次更新重點支援 780B 參數 MoE 模型 HYV4 (Hy4-Preview)。該模型每次 token 啟動 49B 參數,每層包含 256 個路由專家與 1 個共享專家,上下文窗口達 1M tokens。其架構結合了 MLA (Multi-head Latent Attention)、DSA (DeepSeek Sparse Attention)、具備可學習注意力匯聚的 Gated MLA,以及獨立超連接 (iHC)。實作中忽略多 token 預測 (MTP) 層,但保留權重供推測解碼使用。 在其他架構方面,新增 Moonshot AI 的 KimiLinear 混合線性注意力架構,核心採用 Kimi Delta Attention (KDA),每四層保留一個全注意力區塊並重用 DeepSeek-V3 的 MLA 與 MoE 設計。語音與多模態部分,支援阿里達摩院 800M 參數的 Fun-ASR-Nano 端到端語音辨識模型,覆蓋中英日語及 7 種中文方言;H Company 的 NeoMME 多模態原生多語言基礎編碼器(260M 與 800M 參數);採用 next-token diffusion 的多語者長音訊合成框架 VibeVoice;以及 NVIDIA 的 Canary-1B-v2 多語言語音辨識與翻譯模型。
讀原始報導

背景

本次更新中 HYV4 模型所採用的 DeepSeek 稀疏注意力機制(DSA),是隨著 DeepSeek V3.2 引入的模型原生技術。該機制透過輕量級的學習索引器對鍵值(KV)進行評分,讓模型僅關注排名最前面的項目。

來源