模型發布
Cohere 發布 23 億參數多模態模型 Parse 5:支援複雜 PDF 轉 Markdown 與邊界框定位
AI 前線單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據報導,Cohere 於 2026 年 8 月 27 日發布專為企業文件解析設計的多模態基礎模型 Parse 5(parse-v5.0)。該視覺語言模型(VLM)具備 23 億參數與 8K 令牌(token)上下文窗口,能將財務報告與科學論文等複雜 PDF 轉換為規範的 Markdown 格式,並同步輸出精準的邊界框(bounding box)座標,確保下游應用能將擷取的資料視覺定位回原始文件。
架構上,Parse 5 底層基於開放權重架構 North-Micro-Vision-Instruct 構建,整合了基於 SigLIP 2 SO400M 初始化的 4 億參數客製化視覺編碼器(採用 2D RoPE 與學習得到的 1D 位置嵌入保留空間結構),以及基於 Command A+ 架構的 20 億參數自研語言模型(North Micro LLM)。系統透過 Integration(DeepStack)方法,將視覺編碼器多層級輸出的補丁嵌入特徵注入語言模型的淺層網路中。
在包含 2000 多個企業網頁的 ParseBench 基準測試中,Parse 5 在表格擷取、內容保真度與語意格式化取得平均 79.2 分,超越 Mistral OCR 與 Google Gemini 3 Flash (Thinking High) 的 75.05 分,但低於 LlamaParse Agentic Plus 的 90.20 分。
該 API 目前可透過 Cohere 平台、Microsoft Azure AI Foundry 及 AWS Amazon SageMaker 存取。社群討論指出,其在表格擷取與定價上具備優勢,但目前 API 整合尚未支援原生 PDF 檔案輸入,需在傳遞前逐頁渲染;其 24 億參數的開放權重基礎模型也已在 Hugging Face 上架供本地測試與微調。
讀原始報導