模型發布
Cohere 發布 23 億參數文件解析模型 Parse 5,主打性價比,每千頁定價 1.5 美元
VentureBeat單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,Cohere 推出 23 億參數的視覺語言模型 Parse 5,專為企業級文件解析設計,主打性價比而非極致準確率。
該模型基於 North-Micro-Vision-Instruct 架構,具備 8,192 token 脈絡長度與約 4.6GB 容量。其採單次傳遞(single-pass)設計,可將 PDF、PowerPoint 或 JPEG 影像轉為依閱讀順序排列的 Markdown 格式,並將表格渲染為 HTML,同時提供圖片描述與邊界框座標。
在 ParseBench 評測中,Parse 5 於表格、內容忠實度與語意格式化三個維度獲得 79.2 分,落後於 GPT-5.5(84.4)、Opus 4.8(84.3)與 Gemini 3.5 Flash(81.8),但領先 LlamaParse Cost Effective 方案(78.3)、Mistral OCR 4(74.5)及 Azure Document Intelligence(69.3)。
Cohere 在評測中排除了版面配置與圖表兩個維度,表示目前模型僅提供圖表描述而非提取底層資料,圖表資料提取功能將於未來版本推出。語言方面,支援英、日、韓、阿拉伯等 9 種語言的穩定準確率,其他語言則提供 zero-shot 支援。
模型定價為每 1,000 頁 1.5 美元,目前已透過 Cohere API、Model Vault、Microsoft Foundry 與 AWS SageMaker 全面開放。
讀原始報導背景
視覺語言模型(Vision Language Model, VLM)是一種能同時處理與理解圖像和文字的多模態人工智慧系統。這類模型擴展了大型語言模型僅能處理純文字的限制,可應用於視覺問答或圖像描述等任務。