Cloudflare 推出 Clef-omni:開放權重模型同時處理文字、圖像、音訊與視訊,並降價 Clef-flash
Clef-omni 建基於 Qwen3-Omni-30B-A3B-Instruct MoE,21 秒含聲音影片約 1.5 秒完成評分,並上架 HuggingFace。
Cloudflare Blog一手來源
34 則值得知道的變化
Clef-omni 建基於 Qwen3-Omni-30B-A3B-Instruct MoE,21 秒含聲音影片約 1.5 秒完成評分,並上架 HuggingFace。
模型支援文字生圖與影像編輯,可透過 Diffusers 的 QwenImage21Pipeline 在 CUDA 上部署,並以 CFG=1 與 prefix KV caching 加速推論。
使用者可在無限畫布集中素材與方案,生成圖片後繼續調整文字、配色和版面,相關 Agent 也能完成圖片、影片與整套設計。
訪談稱團隊沿用 Luna 權重、未重新訓練,透過結構化輸出與並行處理加速首次決策回傳,並支援多題批次處理。
RLCD 讓模型輸出選擇、評分與機率,開發者可用閾值決定自動執行或轉交人工,Jev 目標是提升每美元可取得的智慧。
模型宣稱以單一 JSON 信封輸出版面、OCR、ASR、圖表與影片事件等結構化結果,並在 OmniDocBench v1.6 獲 96.96 分。
模型採 Apache-2.0 授權,基於 Qwen3.5-4B 微調;貼文稱在 H100 上每次決策約 30 毫秒。