跳到主要內容
2026-08-09 日報
前瞻與傳聞

MiniMax H3 團隊確認將釋出 2K 生成模型與 Sparse Attention 實作,並正開發專屬圖像模型

InfoQ 中國多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

MiniMax H3 團隊於 Reddit r/StableDiffusion 社群舉辦 AMA,針對開放權重後的技術細節與後續計畫進行說明。 針對 2K 解析度生成,官方確認近期將釋出 H3-Regenerate-2K 模型。該模型並非傳統超解析度(Upscaler),而是專屬的潛在空間 DiT(latent-space DiT)重生成檢查點,會將基礎模型生成的內容與部分參考輸入作為額外上下文來重新生成細節。 在推論最佳化方面,H3 並未沿用 M3 模型的 MSA,而是採用類似 MoBA 風格的區塊選擇(MoBA-style block selection),透過對相鄰視覺 Token 進行平均池化(mean pooling)來減少 Attention 計算。目前僅針對影片 Token 進行三維稀疏化,官方計畫近期釋出保守的 Sparse Attention 參考實作,以確保無感知品質損失為首要目標。 針對社群期待的 4 步或 8 步低步數版本,官方表示目前釋出的檢查點已包含 CFG 蒸餾(CFG Distillation),正積極評估 4-NFE 或 8-NFE 版本,但為避免如第三方 Turbo LoRA 出現的人體結構與音訊退化問題,暫無明確釋出時間表。 團隊首度透露正從 H3 共同祖先模型派生專屬的圖像生成模型。該模型將透過權重切片(Weight Slicing)沿用 H3 的二維 VAE Encoder,並搭配專屬設計的 VAE Decoder。官方建議未來的工作流為:先用該圖像模型生成首幀,再交由 H3 的 I2VA 模式生成影片。 官方也承認目前 Ref2VA(參考生成影片)的畫質退化比 FL2VA(圖生影片)更明顯,主因為兩者採用不同的後訓練策略(Post-training Strategy),目前正著手改善,並確認遠處主體像素化的問題屬於系統級 Bug。 研究團隊指出,H3 強大的提示詞遵循能力源於大規模多樣化資料與通用架構;內部實驗發現,僅訓練模型「根據首幀與文字預測最後一幀」,模型便能在無專門後訓練下展現強大的零樣本(Zero-shot)圖像編輯能力。
讀原始報導

背景

Diffusion Transformer (DiT) 架構通常運作於壓縮的潛在空間中,能將圖像與文字輸入投影至聯合潛在空間以建立語意連結。MiniMax H3 模型的 2K 輸出方案即採用了基於潛在空間的 DiT 檢查點(latent-space DiT regeneration checkpoint)來進行條件生成。

這則事件的發展

  1. 2026-08-06開源模型 MiniMax H3 登頂 Design Arena 影片生成三項榜首,擊敗 Gemini Omni Flash
  2. 2026-08-04MiniMax-H3公開上架,可生成最長15秒2K立體聲影片
  3. 2026-08-04MiniMax H3登頂Video Arena開源影片模型榜
  4. 2026-08-04MiniMax 稱 H3 首達 SD 級影片品質並開放權重,但截至 2026 年 8 月 1 日尚未釋出
  5. 2026-08-01MiniMax H3 登陸 Magnific:即將開放權重,支援最多 9 張圖片、3 段影片與 2K 輸出

來源

相關主題