研究與評測
論文提出 Wavefront Decoding 自我投機解碼框架,為循環語言模型提升最高 4.81 倍解碼速度
Reddit r/LocalLLaMA單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群分享的一篇最新論文,研究人員針對循環語言模型(Looped language models)提出名為 Wavefront Decoding(WFD)的免訓練自我投機解碼(self-speculative decoding)框架。循環語言模型透過重複呼叫共享權重的區塊來增加有效深度,但會導致解碼延遲大幅增加。
WFD 利用該架構的兩項特性:以中間遞迴輸出作為草稿預測,並透過權重共享,將不同位置與遞迴深度的 token 狀態合併在單一批次中處理。該方法將混合深度的狀態組織成「對角波前(diagonal wavefront)」,在同一遞迴呼叫中同步進行淺層位置的草稿生成與早期位置的全深度驗證,被拒絕的草稿則使用全深度預測進行修正,藉此取代傳統分階段的排程。
實測數據顯示,在六個 Spec-Bench 任務類別中,WFD 在 Ouro-2.6B 模型上較自迴歸解碼加速 2.42 倍,在 Huginn-3.5B 上加速 3.54 倍,表現穩定優於傳統的「先草稿後驗證」方法。若進一步搭配跨遞迴 KV 共享(Cross-recurrence KV sharing)以減少波前 KV 流量,在 Huginn-3.5B 上的加速比可提升至 4.81 倍。相關程式碼已於 GitHub 發布。
讀原始報導