開發生態
H3-metal 實現 Apple Silicon 原生 MiniMax-H3 推論,SSD 串流模式將 DiT 記憶體佔用降至 2GB
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
H3-metal 專案實現了 MiniMax-H3 模型在 Apple Silicon 上的原生推論,目前正針對 M3 Max 與 M5 Max 進行 Metal 效能與記憶體最佳化。
該專案支援文字生成影音、首尾幀條件控制(first/last-frame conditioning)以及有序的 Ref2VA 參考輸入。其互動式對話模式可將 BF16 提示條件、DiT 與影片解碼器保留於記憶體中,避免重複載入與編碼。在生成設定上,支援透過 `--show` 參數在 Kitty、iTerm2 等圖形化終端機中即時預覽生成過程的中間幀,此功能會增加約 10 GiB 的暫時性模型記憶體佔用。
效能方面,在 M5 Max 上執行 512x512 解析度、22 幀的影片生成,4 步去噪僅需約 3.5 秒(29 步基準測試為 26.4 秒),全影片 SSIM 達 0.556。
針對低記憶體環境,專案提供 `--ssd-streaming` 模式,在不進行量化、維持原始 BF16 權重的情況下,僅在記憶體保留 2 個 DiT 區塊,其餘由 SSD 串流讀取。此模式可將 DiT 記憶體佔用從約 36.5 GiB 大幅降至 2.0 GiB(512x512 解析度),代價為生成速度降低 84%;在 864x480 解析度下記憶體佔用為 2.1 GiB,速度則降低 26%。
讀原始報導背景
MiniMax 是一間總部位於上海的人工智慧公司,專注於開發多模態 AI 模型與影片生成服務。新聞中提及的 DiT(Diffusion Transformers)則是一種結合擴散模型與 Transformer 架構的技術。
社群討論
社群高度期待 MiniMax-H3 的 Apple Silicon 原生最佳化,因過去在 ComfyUI 中,M4/M5 Mac 生成 9-15 秒 480p 影片需耗時 1 至 1.5 小時,而 RTX 5090 等高階顯卡僅需 2-3 分鐘,凸顯了 Diffusion 模型對算力的極高要求。實測指出模型峰值記憶體佔用約 40.1GB,64GB 或 96GB 的 Mac 即可運行,且原生推論有望將生成時間大幅縮短至約 75 秒。此外,網友建議使用官方 int8_convrot 量化模型取代 GGUF 以取得最佳平衡,並期待未來導入 sparse attention 進一步加速。