跳到主要內容
2026-07-25 日報
模型發布

ESP32執行2,890萬參數模型

Hacker News
開發者在約 8 美元的 ESP32-S3 上離線執行 2,890 萬參數語言模型,端到端速度約為 9.5 tok/s,並公開韌體、訓練、量化與實驗程式碼。模型運用源自 Gemma 的 Per-Layer Embeddings,將其中 2,500 萬個參數留在 flash 查詢表,使 4-bit 模型以 14.9MB 容量部署於微控制器。模型僅以 TinyStories 訓練,適合生成簡短故事,無法回答問題、遵循指令、撰寫程式或提供事實知識。
讀原始報導

背景

Per-Layer Embedding(PLE)是 Gemma 3n 採用的技術,會在模型執行期間建立資料,以提升各模型層的效能。Gemma 3n 的 PyTorch 實作顯示,這套逐層嵌入系統也能在推論時顯著最佳化記憶體使用,因而成為將模型部署到記憶體受限裝置的重要背景。

社群討論

整體風向高度讚賞以 per-layer embedding 技巧在微控制器上跑出 9.7 tokens/sec,並看好搭配約 20–30M 參數的 TTS,實現近即時、完全離線的語音裝置;也有人指出 $5 的 Milk-V Duo 已有最高 256MB 記憶體與 1 TOPS@INT8 TPU。質疑則集中在量化後準確度、Flash/記憶體頻寬與擴展至更大模型的可行性,其中有人澄清 Flash 讀取幾乎不造成磨損,另有反對者認為 MCU 限制太多、用途不大,還可能引發缺貨或催生帶廣告的裝置。

來源