研究與評測
Naver AI 提出推測解碼訓練框架 VAT,提升草稿模型接受長度達 11.4% 與推理速度 8.7%
HF Daily Papers一手來源
尚未逐項核實
來源為發布方或研究資料;不代表所有主張已獲獨立核實。
Naver AI 團隊提出 Verification-Aware Training (VAT) 框架,旨在改善推測解碼(speculative decoding)中草稿模型(draft model)的訓練方式。現有訓練方法通常採用固定權重,未考慮目標模型在循序驗證時「一旦拒絕即丟棄後續所有 token」的特性。
VAT 透過在訓練步驟中模擬驗證過程,將接受與拒絕模式轉為監督訊號。該框架包含兩個核心組件:一個輕量級的聯合訓練二元分類器(verification head),用於預測每個位置的 token 是否能通過驗證;以及驗證自適應權重機制,在每個樣本的首次拒絕點之前保持完整權重,並從該點重新計算衰減。
VAT 僅修改訓練目標,不改變草稿架構、目標模型或推理流程。實驗將其疊加於 EAGLE-3 與 DFlash,並在 Qwen3-4B、Qwen3-8B 及 LLaMA-3.1-8B 上進行測試,結果顯示平均接受長度最高提升 11.4%,實際推理速度(wall-clock speedup)提升達 8.7%,且在數學、程式碼與對話基準測試中均有穩定增益。程式碼將於 GitHub 開源。
讀原始報導背景
Speculative decoding 是一種針對自迴歸大型語言模型(LLM)的推論最佳化技術,能在單一步驟中生成多個 token。其運作方式是先由較小的草稿模型(draft model)提出候選 token 序列,再交由較大的目標模型(target model)在一次前向傳播中進行驗證。