模型發布
新研究開源 3 億參數 Transformer 模型,僅經合成非語言資料訓練即可透過上下文學習 6 種人類語言
Reddit r/MachineLearning單一來源
尚未逐項核實
目前依單一來源整理,這是來源數量描述,不是對消息真假的判定。
據 Reddit r/MachineLearning 討論,研究人員發表論文《Learning to Learn a Language》,開源一款 3 億參數的位元組級(byte-level)Transformer 模型。受 TabPFN 概念啟發,該模型僅使用隨機採樣的循環因果模型生成的合成序列進行訓練,完全未接觸任何真實語言資料。
實測顯示,在凍結權重的情況下輸入維基百科文本,該模型能透過上下文學習(in-context learning)英文、中文、印地文、阿拉伯文、日文與韓文等 6 種語言;隨著讀取量增加,下一個位元組的預測誤差在讀滿一百萬個位元組後,從 8 bits/byte 顯著降至 0.9 到 2.4 bits/byte。此外,模型也能完全在上下文中學會計數、比較數字、近似加法,以及預測質數或 Kolakoski 序列等確定性數學序列。
研究人員指出,儘管該模型在測試時最多只讀取百萬位元組,文本表現仍遠不及經兆級 token 訓練的傳統語言模型,但此研究證實了語言的上下文學習能力可單獨源自非語言的合成先驗。相關程式碼與模型權重已於 GitHub 及 Hugging Face 開放。
讀原始報導