模型發布
MiniMax-H3公開上架,可生成最長15秒2K立體聲影片
X @MiniMax_AI綜合 5 家報導來源有分歧
尚未逐項核實
鈦媒體稱H3為開源模型,官方公告則僅稱其已公開提供,所附內容不足以確認兩者對「開源」的定義是否一致。
MiniMax 已在 Hugging Face 公開提供通用全模態生成系統 MiniMax-H3,並提供透過 Diffusers、雲端筆記本及推論服務使用模型的方式。H3 於7月31日發布,可統一理解文字、圖像、影片與音訊內容,並生成4至15秒、24 FPS的影片;預設輸出短邊為768像素,透過 H3-Regenerate-2K 可達2K解析度,同時產生32 kHz原生立體聲。模型支援多種長寬比,並可接受圖像、影片及音訊作為參考素材。MiniMax 宣稱,H3生成2K影片的成本不到主流競爭產品的三分之一,且設計時已考量多款中國製晶片的相容性。鈦媒體將H3稱為「開源多模態模型」,但官方公告僅明確表示模型已公開提供;另有轉述指出其授權兼顧開源與區域智慧財產權保護,但現有內容未提供具體授權條款。
⚠️ 來源分歧:鈦媒體稱H3為開源模型,官方公告則僅稱其已公開提供,所附內容不足以確認兩者對「開源」的定義是否一致。
讀原始報導背景
Hugging Face 的 Diffusers 是一套以 PyTorch 支援影像、影片與音訊生成的擴散模型軟體。其 DiffusionPipeline 可快速從 Hugging Face Hub 載入預訓練管線進行推論,但不適合用於模型訓練或微調。
來源
- X @Xianbao_QIANnitter.net
- 科技新報 AItechnews.tw
- Reddit r/LocalLLaMAreddit.com
- 鈦媒體tmtpost.com
- huggingface.co
- github.com