跳到主要內容
2026-08-06 日報
模型發布

據報 Ling-3.0-flash MXFP4 釋出,單台 DGX Spark 本機實測解碼達 80 tok/s

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群消息指出,Ling-3.0-flash MXFP4 版本已釋出,並成功在單台 DGX Spark 上進行本機運行。實測數據顯示,該模型的解碼速度約為 80 tok/s,長輸入預填充(prefilling)速度落在 2,500 至 3,500 tok/s 之間。在並發效能方面,系統可順暢支援 3 至 4 名使用者同時操作,適用於程式碼編寫、AI 代理(agents)以及離線批次作業等具備隱私需求的本機推論場景。目前官方尚未證實此效能數據。
讀原始報導

背景

Ling-3.0-flash 是由 inclusionAI 所推出的模型。新聞中提到的 MXFP4 涉及區塊浮點(Block floating point)技術,透過讓一組有效數字共用單一指數,能有效節省硬體空間的使用。

來源