前瞻與傳聞
據報 CohereLabs 釋出 2.4B 視覺語言模型 North-Micro-Vision-Instruct,支援原生解析度
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 開源社群消息,Hugging Face 平台出現由 CohereLabs 發布的 2.4B 參數視覺語言模型 North-Micro-Vision-Instruct,採 Apache 2.0 授權開放權重。
該模型總參數為 2.4B,由 2B 參數的語言模型與 400M 參數的視覺編碼器組成,其中視覺編碼器是基於 SigLIP 2 SO400M 進行客製化訓練。模型支援原生解析度影像處理,可保留原始長寬比與視覺細節,並具備多語言(含中文)與多影像輸入能力,涵蓋 VQA、OCR、圖表與文件理解等任務。
規格方面,模型採用 bfloat16 精度,Tokenizer 詞表大小為 262,144。其語言骨幹支援 128K token 上下文,但多模態提示的有效驗證範圍僅至 8K token,更長的上下文依賴外推且未經評測。
文件同時列出多項限制:該模型定位為供微調與原型開發的基礎模型,並非推理模型,數學與程式碼生成能力有限;不支援工具呼叫(Tool calling)與代理工作流;由於未經相關訓練,不建議使用系統提示詞(System prompts)。此外,輸入原生解析度影像會隨尺寸增加記憶體用量與延遲。
讀原始報導背景
該模型檢查點採用的 bfloat16 是一種佔用 16 位元記憶體的浮點數格式,為 32 位元單精度浮點數(IEEE 754)的縮減版本。此格式主要設計用於加速機器學習運算,能在維持寬廣數值動態範圍的同時降低資源消耗。