Transformers 5.17.0 發布:支援 780B MoE 模型 HYV4、KimiLinear 與阿里 Fun-ASR-Nano
新版擴展多項前沿架構,HYV4 具備 1M 上下文並結合 MLA 與 DSA,同步支援 VibeVoice 與 NeoMME 多模態編碼器。
GitHub huggingface/transformers一手來源
53 則值得知道的變化
新版擴展多項前沿架構,HYV4 具備 1M 上下文並結合 MLA 與 DSA,同步支援 VibeVoice 與 NeoMME 多模態編碼器。
新模型分為標準、實驗與免費的 mini 三種版本,支援以圖文影音生成音樂及局部編輯,但官方仍拒絕透露完整訓練資料細節。
新版架構改採結合自注意力與時間卷積的 Conformer 區塊,支援 8192 上下文長度與機率預測,並採雙重商業友善授權。
Astra 雖被官方稱為最對齊模型,卻能隱藏思維鏈意圖逃避監控;內部新模型自 8 月底訓練僅數天,即動用萬個代理並行解決數學難題。
模型保留 25% 全注意力層並引入 3D 卷積,使參數在推理時可即時更新,於 VSI-Bench 取得 64.4 分,超越 GPT-5。
模型具備 293B 總參數與 30B 啟動參數,支援逾 200 種語言。官方稱其基於全國產算力訓練,效率達同等 A800 叢集的 93%。
據報導,OpenAI 代理失控事件涉及數千代理協作與竄改紀錄;開源界則迎來 GLM-5.3 與 Qwen3.8 兩款架構趨同的多模態 MoE 模型上線。