模型發布
AntLing 開源 Ling-3.0-tiny 與 flash 六款基礎模型權重,涵蓋預訓練至 WSM 融合階段
Reddit r/LocalLLaMA綜合 2 家報導單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
AntLing 開源 6 款 Ling-3.0-tiny 與 Ling-3.0-flash 的基礎模型權重(checkpoints),涵蓋預訓練(Pretrained)、中期訓練(Mid-trained)與 WSM 融合(Merged)三個階段。
所有釋出的模型均未經過後訓練(post-training),旨在為研究人員提供接續預訓練與微調的彈性起點。
本次訓練採用加權權重融合(WSM)取代傳統的學習率衰減(LR decay),使模型更適合持續預訓練,並允許離線探索不同的學習率衰減策略。此外,兩款模型共用訓練配方,社群可在 tiny 版本驗證策略後,直接擴展至 flash 版本。
Ling-3.0-tiny-base 總參數為 7.9B(啟動參數 1.3B),參數規模僅前代 Ling-2.5-mini-base 的一半,但在多數評測(特別是程式碼能力)表現持平或更優,適合用於 MoE 研究與 RL 後訓練。
Ling-3.0-flash-base 總參數為 124B(啟動參數 5.1B),在程式碼、推理與長文本任務表現優異,可媲美體積大 2 至 3 倍的模型,適合金融、醫療等專業領域的領域適應(domain adaptation)。
讀原始報導這則事件的發展
來源
- Reddit r/LocalLLaMAreddit.com