跳到主要內容
2026-10-07 日報
研究與評測

論文提出 FactorEngram 記憶體架構,採基底層級閘控提升 1B 模型效能

Reddit r/LocalLLaMA單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據 Reddit 社群分享的論文資訊,研究人員提出名為 FactorEngram 的新型 n-gram 記憶體架構,旨在優化大型語言模型(LLM)的參數擴展。現有的查表式記憶體(如 Engram)將檢索到的嵌入視為單一單元,由單一純量閘控調節,導致模型無法針對多義詞依上下文選擇性讀取相關記憶,且參數僅透過缺乏語意關聯的雜湊碰撞來共享。 FactorEngram 導入基底層級的上下文閘控機制,透過跨模式共享的基底向量字典檢索具稀疏正則化的係數。模型會利用主幹隱藏狀態對每個基底向量進行評分,藉此在重建前閘控對應係數,讓上下文能獨立調節各個記憶組件。 實驗顯示,該架構涵蓋單一 token 與多 token 的 n-gram,在 340M 與 1B 參數的 Transformer 模型上均提升了語言建模與下游任務效能。消融實驗進一步確認各組件的貢獻,並指出將記憶體分支插入於中間層的注意力(attention)子層之前為最有效的配置。
讀原始報導
本期分類