模型發布
SenseNova-Vision-7B-MoT 視覺模型發布:基於 Bagel 微調,單一模型整合物件偵測、OCR、深度圖與遮罩
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群討論,基於字節跳動 Bagel 微調的多模態模型 SenseNova-Vision-7B-MoT 發布,單一模型整合了物件偵測、OCR、深度圖與遮罩生成四項任務。
該模型總參數為 14B(啟動參數 7B)。物件偵測與 OCR 結果會以純文字附帶座標輸出,深度圖與遮罩則以生成圖片形式輸出。
論文數據顯示,其在選定的物件偵測與 OCR 測試中排名第一(含一項平手),並在所有深度圖資料集擊敗 Depth Anything V2,但多數成績仍落後於 MoGe-2;在遮罩測試中,專用的分割模型仍保持多數領先。
本地部署門檻較高,官方 README 僅在單張 80GB A800 進行驗證,尚未完全確認較小顯卡的相容性。目前未提供 GGUF 格式,且 llama.cpp 尚未支援載入 Bagel 架構。此外,儘管基礎模型 Bagel 採 Apache 2.0 授權,該微調模型的權重僅限非商業用途。
讀原始報導