模型發布
Liquid AI 推出邊緣視覺語言模型 LFM2.5-VL-3B,強化螢幕理解與定位
HuggingFace Blog綜合 2 家報導一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Liquid AI 推出專為邊緣設備設計的視覺語言模型 LFM2.5-VL-3B。該模型參數為 3.1B,檔案大小約 2GB,可於手機端本機運行。架構上,LFM2.5-VL-3B 結合了 SigLIP2 400M NaFlex 視覺編碼器與 LFM2.5-2.6B 文本骨幹,並透過擴充 Tokenizer 將詞彙表倍增至 128K 以支援非拉丁語系。模型使用約 34T tokens 進行預訓練,視覺數據量為前代的 4 倍;後訓練階段則包含監督式微調(SFT,含知識蒸餾與 Antidoom 訓練)及多獎勵強化學習(RL)。
官方指出,新版模型在螢幕與 UI 理解、自然語言物件定位(Grounding)、多圖像推理及函數呼叫能力上有顯著提升,並在真實世界圖像基準測試中領先同級別模型。其中,ScreenSpot-v2 desktop 測試分數由前代的 6 大幅提升至 78.7。在實際邊緣設備測試中,開發者於 iPhone 17 本機運行該模型,約耗時 2 分 31 秒即可完成實體物件的圖像辨識與詳細特徵描述。
讀原始報導背景
LFM2.5-VL-3B 採用的 SigLIP2 是一系列多語言視覺語言編碼器,透過解碼器預訓練與自我蒸餾等技術來提升密集預測任務的表現。其後訓練階段使用的 Antidoom 技術,則是專門用來消除推理模型中常見的重複性迴圈(doom loops),透過局部偏好訓練來避免模型選擇會導致重複的 token。
來源
- X @liquidainitter.net
- Reddit r/LocalLLaMAreddit.com
- Reddit r/LocalLLaMAreddit.com
- huggingface.co
- github.com
- github.com