模型發布
開發者釋出 Rust 從頭撰寫的非 Transformer 模型 PSSA:CPU 推論快 12 倍,同參數困惑度勝出
Hacker News單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
開發者在 GitHub 釋出名為 PSSA 的小型語言模型,該模型並非 Transformer 架構,而是完全使用 Rust 從頭撰寫,底層不依賴 PyTorch 或 TensorFlow 等任何機器學習框架。開發者表示,放棄現有 autograd 框架是為了實現逐 token 的權重更新與前向傳播時的記憶體寫入,並確保梯度能與純量參考路徑進行精確比對(最大梯度誤差約 3e-8)。
PSSA 的運算成本隨序列長度呈線性增長,而非平方增長。其架構結合了類似 S4 與 Mamba 的選擇性狀態空間遞迴(selective state-space recurrence),以及位於雙曲空間(hyperbolic space)的情節記憶庫(episodic memory bank)。模型在單次由左至右的傳遞中維持固定大小的狀態,並透過查詢當前 token 與狀態,從記憶庫中讀取最多 4 個插槽(slots)的內容,而非重新讀取整個上下文。
該模型具備執行時重寫自身權重的「可塑性」(plasticity)。當輸入狀態具備新穎性時,系統會插入新的記憶插槽,並透過不反應計數器(refractory counter)限制覆寫頻率以保護已穩定的記憶;同時利用閉式脊迴歸(closed-form ridge regression)將快速更新整合回基礎轉移矩陣中,避免長程結構僅儲存於外部記憶。
在效能評測上,PSSA 與標準 Transformer 在相同參數、相同 tokenizer 與相同設定下進行對比。在 1270 萬 token 的 WikiText-103 訓練中,PSSA 的最終交叉熵為 3.98(困惑度 53.7),優於 Transformer 的 4.43(困惑度 83.7)。Transformer 耗盡 1270 萬 token 訓練預算才達到的損失值,PSSA 在約 200 萬 token 時就已超越,且在同等 CPU 上的文字生成速度快約 12 倍。
讀原始報導背景
主流語言模型多採用 Transformer 架構,其運算成本會隨序列長度呈平方增長;而結合遞迴與連續時間特性的狀態空間模型(State-Space Models)則成為另一種發展方向。此外,多數模型開發高度依賴自動微分(Autograd)系統,但這類框架在處理需要逐字元(per-token)更新權重的特殊架構時,往往會產生諸多限制。
社群討論
社群強烈質疑標題強調「用 Rust 實作」是騙點擊,認為未用主流 PyTorch 會導致難以釐清是架構創新還是實作差異,但少數人讚賞其免除 Python 依賴的部署便利性。針對模型本身,部分人懷疑這僅是缺乏新意的 RNN 或神經圖靈機(NTM),但也有留言具體點出其與 NTM 的差異,如採用 Poincare ball 內容尋址與 novelty-gated 寫入限制。