FLUX 3 Action 7B 開源發布:登頂 RoboLab 基準,參數少 56% 且速度快 3.95 倍
該模型能同時預測影片與動作,規劃未來的距離翻倍,並支援微調應用於機器人、遊戲與電腦操作等視覺決策場景。
Reddit r/singularity單一來源
71 則值得知道的變化
該模型能同時預測影片與動作,規劃未來的距離翻倍,並支援微調應用於機器人、遊戲與電腦操作等視覺決策場景。
該模型能掃描壓縮文字影像,透過學習工具僅將相關頁面展開為未壓縮形式,社群已提供 GGUF 格式,模型採 Apple 研究授權。
該模型能以 1 秒分塊即時輸出語者標籤,填補本地語音 Agent 辨識說話者身分的空白,並已獲 Transformers 零日整合。