跳到主要內容
2026-08-20 日報
模型發布

AntLing 開源 Ling-3.0-tiny 與 flash 六款基礎模型權重,涵蓋預訓練至 WSM 融合階段

Reddit r/LocalLLaMA綜合 2 家報導單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

AntLing 開源 6 款 Ling-3.0-tiny 與 Ling-3.0-flash 的基礎模型權重(checkpoints),涵蓋預訓練(Pretrained)、中期訓練(Mid-trained)與 WSM 融合(Merged)三個階段。 所有釋出的模型均未經過後訓練(post-training),旨在為研究人員提供接續預訓練與微調的彈性起點。 本次訓練採用加權權重融合(WSM)取代傳統的學習率衰減(LR decay),使模型更適合持續預訓練,並允許離線探索不同的學習率衰減策略。此外,兩款模型共用訓練配方,社群可在 tiny 版本驗證策略後,直接擴展至 flash 版本。 Ling-3.0-tiny-base 總參數為 7.9B(啟動參數 1.3B),參數規模僅前代 Ling-2.5-mini-base 的一半,但在多數評測(特別是程式碼能力)表現持平或更優,適合用於 MoE 研究與 RL 後訓練。 Ling-3.0-flash-base 總參數為 124B(啟動參數 5.1B),在程式碼、推理與長文本任務表現優異,可媲美體積大 2 至 3 倍的模型,適合金融、醫療等專業領域的領域適應(domain adaptation)。
讀原始報導

這則事件的發展

  1. 2026-08-07華為昇騰 0 Day 支援螞蟻 Ling-3.0-flash 模型,首度引入 CANN PyPTO 自動化算子編程框架
  2. 2026-08-07混合推理模型 Ling-3.0-tiny 發布:總參數 79 億、每次 token 僅啟用 13 億,首週免費

來源