跳到主要內容
2026-08-16 日報
研究與評測

至知研究院等提出大模型可解釋性方法 SWD:直接拆解權重抽取迴路,資料成本不到訓練型基線 1%

量子位單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

至知創新研究院(IQuest Research)聯合 Safe AI Forum、牛津大學、史丹佛大學與清華大學,提出稀疏權重分解(Sparse Weight Decomposition, SWD)方法,用於大模型機制可解釋性研究。有別於 Transcoder 等需訓練獨立替代網路的方法,SWD 直接將預訓練模型中的稠密權重矩陣分解為兩個稀疏矩陣,共享的中間維度成為可獨立評分與消融的瓶頸單元,藉此直接在權重上抽取任務迴路。 實驗數據顯示,在匹配替換保真度的單矩陣實驗中,SWD 使用的資料量不到 Transcoder 等訓練型基線的 1%。在 GPT-2、Qwen2.5(0.5B 至 3B)及 Qwen3.5-27B 的任務迴路實驗中,SWD 能以更少的瓶頸單元和活躍連接達到相同的充分性與必要性目標。與奇異值分解(SVD)相比,SWD 將稀疏性施加到每個單元的讀寫連接上,在相同的歸因和消融流程下需要更少的活躍連接。 該方法已擴展至全模型替換,覆蓋 GPT-2 Small 全部的 48 個注意力和 MLP 權重矩陣。將 SWD 作為稀疏初始化並微調保留的非零值後,使用約 2,060 萬個 token 即將模型交叉熵(CE)從 3.90 降至 3.44,資料量不到稀疏預訓練基線(28.84 億個 token)的 1%。 SWD 亦提供完全不需校準文本的 zero-data 版本,直接最小化原權重與分解權重間的 Frobenius 誤差即可抽取有效迴路。此外,在 GPT-2 Small 的定向編輯實驗中,單個 SWD 方向(c205)能將正確答案的 logit margin 提高 0.216,且副作用低於隨機單元與 rank-4 LoRA 對照組。相關論文、程式碼與模型均已公開。
讀原始報導
本期分類