研究與評測
ICML 2026 論文提出 ToMoE 動態剪枝法:將稠密 LLM 轉為 MoE 架構,無須微調即超越過往技術
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群分享,一篇獲 ICML 2026 接收的論文提出名為 ToMoE 的可微動態剪枝(differentiable dynamic pruning)方法,能將稠密大型語言模型轉換為混合專家(MoE)架構,以降低部署與推論時的運算及記憶體成本。
過往的結構剪枝技術常因永久移除模型結構而導致效能大幅下降;ToMoE 則透過將模型的 MLP 層轉換為 MoE 架構,在不永久刪除參數的前提下,減少並維持固定數量的活躍參數。
實驗結果顯示,該方法即使在未經微調的狀態下,效能仍穩定超越先前的結構剪枝技術。此方法已在 Phi-2、LLaMA-2、LLaMA-3 及 Qwen-2.5 等多個模型系列上完成驗證,相關程式碼目前已於 GitHub 開源。
讀原始報導背景
混合專家模型(Mixture of Experts, MoE)是一種機器學習技術,透過多個專家網路將問題空間劃分為同質區域來處理任務。相較於密集模型(Dense model),MoE 能以更少的運算資源進行預訓練,讓開發者能在相同的運算預算下大幅擴展模型或資料集規模。
來源
本期分類