跳到主要內容
2026-08-17 日報
模型發布

研究團隊發布 LittleLearner 模型,僅用小學五年級以下資料訓練,證實預訓練決定 LLM 能力天花板

Hacker News單一來源
尚未逐項核實

目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。

據報導,研究團隊發布 LittleLearner 專案,探討將大型語言模型訓練資料嚴格限制在美國小學五年級(K-5)程度的影響。該研究旨在釐清模型的新技能是真正學會的,還是僅被激發出來的。 團隊建構了 880 億 token 的 LittleCurriculum 語料庫,該語料從 FineWeb-Edu 萃取並經過五階段過濾,明確排除五年級以上的概念、事實與詞彙。基於此語料,團隊從頭訓練了 0.6B、1.3B 與 5B 三種參數規模的 LittleLearner 模型,並為每個模型配備架構與訓練配方相同的未過濾對照組(Unfiltered control)。釋出的權重包含基礎模型(Base)、經 MathCAMPS 訓練的數學特化版(GRPO),以及通用對話版(Chatty)。 實驗結果顯示,預訓練資料的過濾設定了模型能力的實質天花板。擴展模型規模能提升範圍內的表現,但對超出範圍的進階問題幾乎沒有幫助。此外,透過 GRPO 進行後訓練雖能顯著提升 K-5 範圍內的能力,但即使使用範圍外的資料進行訓練,也無法恢復 K-5 以上的能力。針對 5B 模型的測試也表明,上下文學習(In-context learning)同樣無法解鎖超出範圍的新推理能力。 該專案提供了一個受控的沙盒環境,可用於研究強化學習(RL)是否能創造新能力、觀察單一概念的學習與遺忘過程,以及比較機器與人類兒童的學習差異。
讀原始報導

背景

大型語言模型在微調階段常使用 GRPO(Group Relative Policy Optimization)等強化學習技術來提升特定能力。GRPO 透過直接將 KL 散度作為懲罰項加入損失函數中,省去了評論家模型(critic)的需求,進而簡化了計算過程。

社群討論

社群肯定此實驗有助於驗證模型能否產生新知識,但強烈質疑其「僅限小學五年級」的資料過濾成效,實測發現模型不僅會回答瑞利散射等超綱內容,遇到 -1 的平方根或排序演算法等未知問題時更會陷入胡言亂語或無限迴圈,缺乏人類說「不知道」的後設認知。此外,論文結論指出擴展模型與後訓練皆無法突破預訓練資料的能力天花板,部分網友認為這對深信擴展法則的頂尖 AI 實驗室是個悲觀警訊。

來源