模型發布
Youtu-Parsing-Omni 據報以 5B 參數開放權重,統一解析文件、圖像、音訊與影片
Reddit r/LocalLLaMA單一來源
核實資料不足
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
本次未取得足夠原文證據
Reddit r/LocalLLaMA 一則貼文介紹 Hugging Face 上的 Youtu-Parsing-Omni,稱這是騰訊優圖推出的 5B 全模態解析模型;目前除該貼文外沒有佐證來源,相關資訊尚未獲獨立確認。貼文稱,模型可接受文件頁面、自然影像、圖表、流程圖、幾何圖形、音訊,以及自然或文字密集型影片,並依任務提示輸出統一的結構化 JSON。支援內容包括版面元素、文字、表格、公式、邊界框、閱讀順序、圖表與流程圖描述、幾何關係、OCR、ASR、說話者、時間戳、聲學事件、動作互動與攝影機運動等。貼文宣稱,Youtu-Parsing-Omni 在 OmniDocBench v1.6 取得 96.96 Overall,在 OmniParsingBench 取得 75.08 平均分,為該評測中僅次於 Gemini-3-Pro 的開放權重模型;其也宣稱模型在 ChemOCR 化學結構辨識與 PDMX-Synth 樂譜辨識上,具備與專用模型競爭的表現。相關儲存庫據稱提供 vLLM 服務外掛、固定服務設定、任務提示與推論範例。
讀原始報導