跳到主要內容
2026-08-14 日報
模型發布

SenseNova-Vision 7B 視覺模型開源:採無特定任務預測頭架構,單一模型支援 3D 重建與 OCR

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群報導,開源視覺模型 SenseNova-Vision 7B 於 7 月 8 日發布,採用 Apache 2.0 授權。該模型基於現有多模態模型開發,主打將所有電腦視覺任務視為單一生成問題,無需針對特定任務設計預測頭(prediction heads)或解碼器。使用者可透過自然語言指令與視覺提示,讓單一模型直接輸出文字(如分類、邊界框、OCR、關鍵點、相機視角)或圖像(如分割遮罩、深度圖、表面法線、多視角點圖)。 報導指出,該模型支援多視角 3D 重建與相機姿態估計,能以單一提示詞取代 COLMAP 等專用工具,並已在最新更新中加入專用評測基準。模型使用 5000 萬筆指令與回應配對資料集訓練,官方已在 Hugging Face 與 GitHub 釋出權重、訓練管線與資料準備工具。不過其硬體門檻極高,完整網頁展示需單張 80GB 顯示記憶體 GPU,執行評測則需 8 張 80GB GPU,一般消費級顯示卡無法運行。
讀原始報導
相關主題