跳到主要內容
2026-10-10 日報
模型發布

Cloudflare 推出 Clef-omni:開放權重模型同時處理文字、圖像、音訊與視訊,並降價 Clef-flash

Cloudflare Blog一手來源
核實資料不足

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

本次未取得足夠原文證據

Cloudflare 宣布推出開放權重決策模型 Clef-omni,可在單一 API 呼叫中處理文字、圖像、音訊與視訊;同時更新 Clef 並調降 Clef-flash 價格,使其低於 Jev。Cloudflare 未在本文公布 Clef-flash 的新價格或 Clef 的具體加速幅度。 Clef-omni 支援 WAV 或 MP3 音訊,以及 MP4 或 WebM 視訊,能將多種輸入直接納入同一套決策流程,免除先把語音轉成文字,或拆分視訊中的音訊與影像通道。模型已上架 HuggingFace,Cloudflare 也提供開發者文件與 API 範例。 架構上,Clef-omni 建基於 Qwen3-Omni-30B-A3B-Instruct 的 MoE 基礎模型,採用其主要理解骨幹,但移除文字轉語音輸出元件。Cloudflare 表示,模型會對完整輸入進行 prefill,並同步評分不同模態與有效參數選項;它不是大型語言模型,不需生成輸出 token,而是透過兩階段注意力路由與詞彙文法,直接從統一序列與內部嵌入中計算符合結構限制的信心分數。 Cloudflare 表示,Clef-omni 的純文字決策中位延遲約 130 毫秒,圖像輸入約 150 毫秒,音訊則為數百毫秒;包含聲音的完整 21 秒視訊片段,約 1.5 秒即可在單一 API 呼叫中完成評分。訓練方式包括凍結 Qwen3 骨幹、訓練 LoRA,以及結合 label-smoothed cross-entropy loss 與 Brier score calibration 的後訓練流程。 在 Cloudflare 自行公布的評測中,Clef-omni 在 BFCL case exact 得分 98.2、ToolRet nDCG@10 得分 66.6、API-Bank accuracy 為 92.7、BANKING77 macro-F1 為 94.8;在 Home appliances case exact 得分 69.3,低於 Clef 的 82.95 與 Clef-flash 的 97.73。其他結果包括 When2Call accuracy 63.3、CLINC150+OOS macro-F1 97.7、BRIGHT nDCG@10 42.0、Amazon ESCI macro-F1 57.8,以及 PhishNChips accuracy 73.2。
讀原始報導