模型發布
Apple 釋出 9B 視覺語言模型 LensVLM,基於 Qwen 修改並可選擇性展開文字影像
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據社群消息,Apple 釋出全新的 9B 視覺語言模型(VLM)LensVLM。該模型主要用於處理文字影像,其運作方式為先掃描壓縮的文字影像,接著透過學習工具(learned tools),選擇性地僅將相關頁面展開為未壓縮形式。
授權資訊顯示,LensVLM 包含 Apple 對 Qwen 模型的修改,模型權重採用 Apple 機器學習研究模型授權(Apple Machine Learning Research Model License),原始碼則採 Apple 範例程式碼授權。目前相關論文與 GitHub 程式碼庫已公開,社群也已在 Hugging Face 釋出 GGUF 量化版本。
讀原始報導