研究與評測
FLUX 3跨足影音與機器人
Hacker News綜合 2 家報導
Black Forest Labs表示,相較於生成圖片的FLUX 1與FLUX 2,FLUX 3是從一開始便以圖片、影片及音訊聯合訓練的多模態基礎模型,可共同生成影音內容。mimic robotics取得早期版本使用權後,雙方開發出影片—動作模型FLUX-mimic,並已在Audi測試及部署的機器人上運行。官方指出,影片預測占整體訓練運算成本逾95%,而帶音訊的720p影片中,音訊占不到0.5%的token;模型藉由學習接觸、運動、重量與因果關係,再將低維度的機器人狀態與視覺觀察結合以預測動作。Latent Space另稱FLUX 3 Video支援文字、圖片、影片及關鍵影格生成影片、原生音訊、多語對話、影音續接、多鏡頭串接與動態排版等功能,並宣稱其表現超越Seedance 2.0、Gemini Omni及Grok Imagine,且開放權重的Dev版本即將推出。
讀原始報導背景
FLUX 3 是 Black Forest Labs 的多模態基礎模型,從訓練初期便以同一套架構學習影像、影片與聲音,與先前主要聚焦影像生成的 FLUX 模型不同。FLUX-mimic 則建立於 FLUX 3 之上,用於通用機器人動作生成;mimic robotics 更早的 mimic-video 已嘗試在預訓練影片生成模型中加入機器人動作預測能力。
社群討論
整體風向肯定從多模態影片生成模型抽取 world representation 並部署到機器人的潛力,尤其約 3 分 30 秒處機械臂歷經 3 次嘗試後成功重新裝好車窗飾條,展現出令人印象深刻的自行修正能力。主要分歧在於其新穎性:有人視為影片實驗室跨足機器人的新路徑,也有人補充 Nvidia、Waymo、Google、Generalist、Luma Labs、Runway 與 Rhoda AI 已有類似方向;另有留言憂慮自動化將進一步削弱勞工價值,以及公司可能遭大型企業收購。