DeepSeek 發布 V4 首款多模態模型 DeepSeek-V4-Flash-Vision-Exp,大幅提升視覺代理能力並採 MIT 授權
基於 V4-Flash 架構加入視覺模組,在多模態評測顯著超越前代並維持同等純文字效能,支援 vLLM 與 SGLang 部署。
HF @deepseek-ai綜合 2 家一手來源
47 則值得知道的變化
基於 V4-Flash 架構加入視覺模組,在多模態評測顯著超越前代並維持同等純文字效能,支援 vLLM 與 SGLang 部署。
基於 1 兆個時間點預訓練,於 Gift-Eval 等三大基準測試登頂,並採連續區塊遮罩技術免除迭代迴圈,提供 9 個分位數機率預測。
該模型為全球最大開源模型,有效參數達 104B,並導入與 DeepSeek V4 相同的 Muon 最佳化器,大幅推升記憶體用量。
HOMIE Gen2 模型全新發布,旨在解鎖人類經驗的 Scaling Law,被定位為專屬於機器人的經驗百科全書。
Google 推出 Gemini 3.7 Flash,Anthropic 年化營收達 650 億美元,OpenAI 則因安全事件暫停模型微調兩週。
解碼器基於 7400 小時音訊文本配對資料訓練以避免依賴純文本先驗,支援問答與 ASR,因沿用 NVIDIA 編碼器僅限非商業授權。