研究與評測
開發者重啟 Apple M1 ANE 逆向工程,揭露 16 核心架構並稱 M5 將整合 NPU 至 GPU
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據開發者發布的文章指出,作者在停滯三年後重啟對 Apple M1 晶片神經網路引擎(ANE)的逆向工程。作者表示,由於預期 2025 年的 M5 晶片主打 LLM 效能,並將把 ANE 核心整合至 GPU 核心中,這標誌著獨立 NPU 的終結,因此決定完成 M1 ANE 的架構解析,以探討 Apple 自 2017 年 A11 Bionic 以來的機器學習硬體演進。
文章詳細揭露了 M1 ANE 的運算架構與硬體規格:
- 具備 16 個運算核心,每個核心擁有 128 條 FP16(或 256 條 INT8)平行乘加(MAC)通道,總計達 2048 條平行 MAC 通道。
- 內部 MAC 資料路徑包含 16 位元乘法器與 32 位元加法器,並在 32 位元暫存器中以 Q16.16 格式累加,最終以 FP16 格式輸出。
- ANE 最初針對具備可預測重複使用模式的密集 CNN 影像處理工作負載進行特化設計。
作者指出,Transformer 架構(特別是自迴歸解碼)打破了 CNN 的資料重複使用模式,使得 ANE 原本高度特化的資料流設計難以發揮效用,這也反映了當前 AI 工作負載向 GPU 靠攏的趨勢。
讀原始報導社群討論
社群高度讚賞此文揭露 Apple Neural Engine (ANE) 最初是為 CNN 而非 Transformer 設計(推測源於耗資百億美元的自駕車專案),導致開發者需將 Transformer 偽裝成 CNN 才能運行。許多人質疑 ANE 擴展性極差(一萬美元的 M1 Ultra 的 NPU 效能僅為 600 美元 M1 的兩倍)且錯失近期 AI 浪潮。但也有人補充,Apple 正透過 M4 引入 INT8 加速、未來的 M6/A20 雙倍 ANE 配置以及全新的 Core AI 框架來迎頭趕上。