研究與評測
研究人員提出 FLEET 演算法:結合記憶與 MCTS 改善生成,LiveCodeBench 測試僅需 9 次迭代即達基準
Reddit r/MachineLearning單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit 社群作者發布,研究人員提出名為 FLEET 的新演算法,旨在透過結合記憶機制與蒙地卡羅樹搜尋(MCTS),改善生成模型在獎勵最大化任務中的 Best-of-N 生成效率,解決傳統重複取樣淪為盲目搜尋的問題。
FLEET 採用自適應取樣技術,追蹤具有高 entropy 與 varentropy 的 logits,將模型不確定的狀態視為分支點。演算法會將對應的正規化隱藏狀態存入向量資料庫,並映射至包含獎勵歷史與節點轉換的元資料中,透過餘弦相似度進行檢索與更新。在生成過程中,FLEET 不直接選擇 token,而是利用修改後的 MCTS 對 top-k token 與探索集進行排序,懲罰次優選項後再將解碼策略應用於修改後的 logits。
在 Llama 3.2 3B 模型的實測中,設定次優 token 機率趨近於零並採用 greedy decoding:
- **GSM8K**:多解決了 7 個任務,並以一半的迭代次數達到取樣基準。
- **LiveCodeBench v6 easy**:在相同預算下,分數從 0.59 提升至 0.69,且僅需 9 次迭代即可達到基準(原需 32 次)。
作者指出,該演算法不強制要求循序執行,可直接作為查找表(lookup table)傳入。其元資料庫也可保留作為其他任務的先驗知識,或用於豐富 SFT 與 RL 訓練。相關論文預印本與程式碼已發布於 GitHub 與 Hugging Face。
讀原始報導