跳到主要內容
2026-08-05 日報
模型發布

Liquid AI 發布 LFM2.5-2.6B 邊緣代理模型,2.5 GB 記憶體即可在裝置端執行,指令遵循與工具呼叫勝過多數 4 倍大模型

HuggingFace Blog一手來源
尚未逐項核實

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

Liquid AI 發布 LFM2.5-2.6B,一款專為邊緣裝置設計的 2.6B 參數代理模型,目標是在記憶體不到 2.5 GB 的環境中執行多步驟代理任務。模型以約 34T token 預訓練,中期訓練階段將上下文視窗擴展至 128K。 後訓練分為四個階段:兩輪以代理資料(工具呼叫、網路搜尋、harness 軌跡)為重點的監督式微調(SFT);針對數學、程式、工具呼叫等領域各訓練一個專家教師模型;透過多領域策略蒸餾(MOPD)將專家教師合併為單一學生模型;最後在 OpenClaw、Hermes Agent 等真實代理 harness 中執行多輪強化學習(Agentic RL),讓模型在不同工具、系統提示與多輪任務環境中學習。Agentic RL 管線將模型最佳化、推論與環境執行拆為獨立元件,透過 Harness Proxy 將代理 harness 視為黑盒,無須修改即可透明擷取 token 級軌跡供訓練使用。 基準測試將 LFM2.5-2.6B 與最大達約 4 倍參數的模型比較。在指令遵循方面,LFM2.5-2.6B 在 IFBench(59.17)、Multi-IF(80.07)、IFStruct(85.49)三項均為最高,分別超越 Qwen3.5-9B(9.7B)的 56.47、62.55、78.50。工具呼叫方面,ToolSandbox 得分 77.83 領先所有對手,BFCLv4 得分 56.88 僅落後 Qwen3.5-9B 的 60.13。代理任務上,τ³-Bench Banking(5.67)與 BrowseComp+(26.89)均為最高或接近最高,Claw-Eval 英文平均 62.85 略低於 Qwen3.5-9B 的 66.53。AIME25 數學得分 51.87,僅次於 Qwen3.5-9B 的 56.07。程式碼(LiveCodeBenchv6 為 59.41)是較明顯落後大模型的領域,gemma-4-E4B-it(8B)達 63.77,Qwen3.5-9B 達 69.86。 推論效能方面,LFM2.5-2.6B 在 Apple M5 Max CPU 上解碼速度達 220 tok/s,AMD Ryzen AI Max+ 395 上為 113 tok/s,手機端約 30 tok/s。GPU 端在高併發下達近 15K 輸出 token/s,單張 H100 約可日產 13 億 token。模型首日即支援 llama.cpp、MLX、vLLM、SGLang 與 ONNX,相容 transformers>=5.0.0。LFM2.5-2.6B 與 LFM2.5-2.6B-Base 均已在 Hugging Face 開放下載,並提供 WebGPU 瀏覽器示範。
讀原始報導