跳到主要內容
2026-08-03 日報
模型發布

開放模型一波發布:Inkling 達 975B-A41B、Laguna-S-2.1 可在 DGX Spark 運行,Kimi-K3 採非商用授權

Interconnects單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Interconnects 單一來源、尚未獲獨立佐證的盤點,近期開放模型發布涵蓋 Inkling、Laguna-S-2.1、Kimi-K3、Hy3 與 DeepSeek-V4-Flash-0731;文章認為,儘管單一實驗室的模型訓練總投入仍可達數億至數十億美元,具備訓練大型模型能力的組織仍持續增加。 Thinking Machines 的首款模型 Inkling 是 975B-A41B 多模態 MoE,可接收文字、圖像與音訊並輸出文字,定位為可透過商業服務 Tinker 微調的基礎模型;另有較小的 276B-A12B 版本。文章並稱,Thinking Machines 在 2025 年 2 月對外宣布公司後,其開放模型微調服務目前每年帶來數億營收。 Poolside 的 Laguna-S-2.1 是重新進行預訓練與後訓練的 118B-A8B MoE,可在 DGX Spark 上運行,採用針對 AI 模型提供法律基礎、類似 Apache 2.0 的 OpenMDW 授權,並公開完整評測軌跡;較小的 Laguna-XS-2.1 則是 33B-A3B MoE 的更新版。 Moonshot AI 的 Kimi-K3 採非商用授權,推論與微調服務供應商須另行簽訂商業協議。Kevin Xu 與 Graham Webster 認為,這類合約關係可能讓美國未來限制本國實體使用中國開放模型的政策工具更容易適用。 Tencent 的 Hy3 是 295B-A21B MoE,文章稱其所有指標均優於前代,授權也從自訂且限制較多的條款改為 Apache 2。該模型另在專用 harness 與 Sol 擔任評審的條件下證明一道已有 50 年歷史的數學問題,但 Sol 在成果中的重要性仍不明確。 DeepSeek-V4-Flash-0731 在 OpenAI 將旗下最小模型價格調降 80% 的隔天發布;Interconnects 稱其在 Pareto frontier 上超越 Luna,但較大的 V4 模型尚未更新。文章指出,初版 V4 系列中 Flash 的單位參數效能較突出,Pro 的表現則相對不理想。 其他發布包括美團的 LongCat-2.0,一款擁有 1.6T 參數的 MoE,全程使用 Ascend 910s 訓練;Motif-Technologies 的 Motif-3-Beta 是 314B-A13B MoE 預覽版,導入 GDLA 與 mHC;Apertus-v1.5-70B 在 Apertus 1.0 基礎上追加 2T tokens 持續預訓練;AMD 的 Instella-MoE-16B-A3B-Think 則以 Instinct 卡訓練,並釋出 base、SFT、MidTrain 與 DPO 等不同階段的 checkpoints。
讀原始報導

這則事件的發展

  1. 2026-07-30開放權重之爭延燒科技圈