跳到主要內容
2026-09-19 日報
模型發布

Cactus Compute 推出 8-29MB 邊緣基礎模型 Needle 3,微調後稱可匹敵 DeepSeek V4 Flash

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,Cactus Compute 推出專為行動裝置、穿戴設備、機器人與微控制器設計的基礎模型 Needle 3。開發團隊表示,該模型捨棄通用對話能力,專注於工具呼叫(Tool calls)、結構化提取與文本嵌入,稱其在行動工具呼叫表現勝過體積 10 倍的模型,並在資料提取上匹敵 2 至 3 倍大的模型。 Needle 3 採用 Simple Attention Network 架構與 CQ2 量化技術,參數規模介於 29M 至 121M,編譯後的單一二進位檔體積僅 8 至 29MB。模型具備「智慧階梯(Intelligence laddering)」設計,提供 2 層至 20 層的子網路供開發者選擇;官方宣稱其 4 層子網路在下游任務微調一個 epoch 後,效能可匹敵 DeepSeek V4 Flash。 該模型使用 3,600 億 token 的專有結構化資料集進行訓練。在 Raspberry Pi 5 實測中,預填(prefill)速度達 1,000 至 10,000 tokens/s,解碼(decode)速度為 400 至 4,000 tokens/s。開發者可透過 Python 套件與 Hugging Face 快取引擎部署,支援以正則表達式設定工具觸發條件,並可結合 Pydantic 輸出強型別的 JSON 格式資料。
讀原始報導

社群討論

社群讚賞此 8-29MB 模型在低功耗邊緣裝置的應用潛力,但強烈質疑其推論能力與宣傳。實測指出模型對非直白指令理解極差且常給出高自信的荒謬結果(如「車禍求救」變成播放音樂、「去廁所」啟動咖啡機),且支援上限約為 10 個 tools。在具體效能對比上,網友測試 Needle 3 W4A8 的精確參數正確率僅 20.4%,遠低於 FunctionGemma BF16 的 85.2%,部分開發者認為其仍不如便宜的 8-27B 區域網路模型或傳統硬編碼規則。