Transformers 5.17.0 發布:支援 780B MoE 模型 HYV4、KimiLinear 與阿里 Fun-ASR-Nano
新版擴展多項前沿架構,HYV4 具備 1M 上下文並結合 MLA 與 DSA,同步支援 VibeVoice 與 NeoMME 多模態編碼器。
GitHub huggingface/transformers一手來源
53 則值得知道的變化
新版擴展多項前沿架構,HYV4 具備 1M 上下文並結合 MLA 與 DSA,同步支援 VibeVoice 與 NeoMME 多模態編碼器。
新版針對 Kimi K3 與 DeepSeek V4 最佳化效能,並透過 Mamba 前綴快取改善 9% 至 25% 的首字延遲。
新版預覽配備 HBM4 記憶體與 224 個 SM 的 Rubin 架構,並導入 MPS V3 強化共享 GPU 管理。
將長提示詞訓練為精簡詞元嵌入,在無損預測品質下使吞吐量提升至 23.4 QPS,並可與前綴快取疊加使用以節省 GPU 資源。
三項成果涵蓋模擬器、資料生成與空間評測,SPEAR 渲染速度達 AirSim 12 倍,實測頂尖 VLM 導航成功率僅 24.49%。
據實測,該 285B 模型透過混合精度與推測解碼,成功在消費級顯卡啟用視覺與工具呼叫,並支援最高 4M 上下文,作者已開源專用映像檔。
結合去年推出的歐盟路由,透過專屬 URL 確保請求在區內解密與推論,若無可用端點則直接阻斷,僅限商務與企業方案使用。
官方建議透過預熱快取與延遲載入工具提升快取命中率,並指出強制思考步驟等舊版提示詞習慣,反而會浪費前沿模型的 token 並增加成本。
平台已納管 99% 加速運算資源,並以 Twinkle 讓 5 個 LoRA 租戶共享基礎模型,對應場景資源消耗降低 80%。