跳到主要內容
2026-08-11 日報
模型發布

Cactus 發布 14MB 邊緣運算模型 Needle 2:45M 參數支援工具呼叫,樹莓派解碼達 500 tokens/sec

Reddit r/LocalLLaMA多家報導
尚未逐項核實

多個報導來源提及此事;未必是彼此獨立的證據。

Cactus 團隊發布專為邊緣裝置設計的 Agentic LLM「Needle 2」,模型為單一 14MB 二進位檔,完整 session 僅需 28MB 記憶體。該模型具備 45M 參數並採 2-bit 壓縮,在 Raspberry Pi 5 解碼速度達 500 tokens/sec,在 Meta Quest 3S 與 Apple Vision Pro 等 VR 裝置達 400-1,500 tokens/sec,於 200 美元以下的平價手機(如三星 A 系列)亦有 300-700 tokens/sec 的表現。 在工具呼叫與行動裝置使用評測中,Needle 2 與 LFM2.5 230M 及 Apple Foundation Model 互有勝負,但體積縮小 5 至 70 倍。其每 token 僅消耗 70 MFLOPs,低於同參數規模 Transformer 的 87 MFLOPs。 Needle 2 基於 Simple Attention Networks 架構,捨棄世界知識與開放式文本生成能力,專注於將自然語言映射至具型別參數的函數。新版擴展了結構化提取功能,可透過傳入 schema 執行文本分類或摘要。 官方提供 Python 套件,支援在 Mac 或 PC 上於數分鐘至數小時內完成微調,並內建自動化資料生成 pipeline。此外,模型每次回應皆會附帶基於 Cactus Hybrid 技術的信心分數,允許開發者在分數低於閾值時,將任務轉交雲端或大型模型處理。
讀原始報導

背景

Cactus 團隊開發的「Simple Attention Networks」架構,透過依賴外部工具列表等知識來源,成功將 MLP 從 Transformer 網路中完全移除。這種專為函式呼叫(Function calling)設計的精簡架構,使模型無需內建龐大的世界知識,從而大幅降低參數與硬體需求。

來源