研究與評測
Gated Recurrent Transformer 架構開源:3 層模型匹敵 12 層 GPT-2,大幅降低 63% 參數
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
研究團隊提出 Gated Recurrent Transformer 架構,透過權重共享與門控機制解決 Transformer 模型在擴展時的記憶體瓶頸。該架構由固定深度的前奏(prelude)與尾聲(coda)區塊組成,中間包夾一個迭代 R 次的單一共享核心,並利用輕量級投影與元素級更新門控來調節每次迭代的特徵,使模型無需增加獨特層數即可實現功能多樣性。
在同等 FLOPs 限制下,3 層的 Gated Recurrent Transformer 準確率可匹敵 12 層的 GPT-2 Small 基準模型;在同等參數與資料預算下,其驗證損失為 2.76,優於非循環架構的 2.84。在大規模測試中,該架構減少了 63% 的參數與 59% 的峰值解碼記憶體佔用,編譯生成延遲僅增加 10%。
此外,由於模型在不同循環深度下進行訓練,推論時原生支援提早退出(early-exit)機制,允許使用者在算力與效能間進行權衡。目前該模型的訓練程式碼已於 GitHub 開源。
讀原始報導背景
大型 Transformer 語言模型在擴展時,常面臨表達能力與記憶體消耗之間的權衡。傳統上,為每一層配置獨立權重會大幅增加記憶體負擔,而簡單共用層數則容易導致模型品質下降。
本期分類