研究與評測
Reddit 討論探討 Transformers、RNNs 與 SSMs 記憶體機制,並以 BDH 架構分析有限狀態壓縮瓶頸
Reddit r/MachineLearning單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit r/MachineLearning 討論,有開發者深入分析 RNNs、Transformers 與 SSMs 的記憶體權衡,探討模型如何處理有限狀態壓縮的根本問題。
分析指出,RNNs 將記憶儲存於遞迴隱藏狀態,面臨 O(N²) 參數僅能攜帶 O(N) 狀態的運算與記憶體比例瓶頸。Transformers 則在推論時凍結權重,將過去表徵儲存為 KV cache 進行注意力計算,屬於管理上下文而非轉化為持久的模型知識。SSMs(如 Mamba)雖回歸固定大小的遞迴記憶體,但採用依賴輸入的保留機制(input-dependent retention),將歷史壓縮至有限記憶體中。
文章特別以 BDH(Dragon Hatchling)架構為例,該模型結合高維神經元空間的線性注意力與低秩 GPU 實作,其遞迴注意力狀態為 N × D 矩陣(N≫D)。在該架構中,相關的神經元活動會產生類似赫布理論(Hebbian-like)的連接更新,使工作記憶與學習到的連接結構更為一致,為工作記憶提供了一種突觸層面的解釋。
作者總結,儘管 BDH 提出新結構,但固定大小的狀態仍具備有限的資訊容量,目前尚無法斷定 SSMs 或以網路為中心的架構是否已徹底解決將歷史壓縮進有限狀態的根本問題。
讀原始報導本期分類