模型發布
研究團隊發表 DiffusionGemma 開放權重模型,單卡 H100 生成速度達 1,500 tokens/s
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 arXiv 最新提交的技術報告指出,研究團隊發表實驗性開放權重語言模型 DiffusionGemma。該模型放棄傳統自迴歸(AR)的逐字解碼,改採離散擴散(discrete diffusion)技術,平行迭代優化 256 個 tokens 的區塊,以解決序列解碼的瓶頸。
DiffusionGemma 並非從頭訓練,而是微調自混合專家架構(MoE)的 Gemma 4(總參數 25.2B,啟動參數 3.8B)。其兩階段訓練流程消耗的 token 預算不到原 AR 模型總量的 10%:第一階段透過監督式微調學習雙向去噪,第二階段則結合強化學習與採樣器蒸餾(sampler distillation)來共同提升生成品質與推論效率。
評測數據顯示,該模型每次前向傳遞(forward pass)平均生成約 20 個 tokens,在單張 NVIDIA H100 GPU 上可達約 1,500 tokens/s 的輸出速度,顯著快於採用先進推測解碼(speculative decoding)的 AR 模型。此外,DiffusionGemma 保留了原模型的思考模式(thinking mode)、多模態輸入與長上下文支援;儘管經過擴散微調,它仍具備 AR 生成能力且僅有輕微效能衰退,為混合擴散與 AR 解碼提供了可行路徑。
讀原始報導背景
傳統自迴歸語言模型在推論時通常一次只能生成一個 token,業界常利用投機解碼(Speculative decoding)技術,透過較小的草稿模型提出候選 token 再由大模型驗證以提升速度。而離散擴散模型(Discrete diffusion model)則是一種包含前向與反向擴散過程的生成模型,為突破傳統循序解碼瓶頸提供了另一種技術途徑。
社群討論
社群高度讚賞 DiffusionGemma 利用現有 MOE 權重直接轉換的創新,且極大提升了本地單 GPU 的生成速度(實測單張 5090 可達 >900 TPS,Pro 6000 達 ~670 tok/s)。然而,使用者指出其準確度與結構化輸出仍遜於原版自迴歸模型,且對預測雜訊的去噪機制效率存疑。此外,開發者對於擴散模型是否適合 Apple Metal 架構,以及草稿機制(drafting)能否有效減少擴散步驟,仍存在技術分歧。