跳到主要內容
2026-09-16 日報
研究與評測

Meta 提出位元組級蒸餾方案 End-Of-Token 準確率上限提升 4%,另傳將推無鏡頭眼鏡 Luna

量子位綜合 3 家報導多家報導
核實資料不足

多個報導來源提及此事;未必是彼此獨立的證據。

查證回合用盡,未形成有依據結論

Meta FAIR 與華盛頓大學共同發表新研究,提出將模型蒸餾的學習單位從詞元(Token)改為位元組(Byte)。由於位元組僅有 256 種基礎數值,此方法可大幅縮小預測空間,使學生模型能保留並學習教師模型的完整機率分布。 研究團隊提出兩種轉換方案:直接聚合機率並重新歸一化的 Marginalize-It,以及在每個 Token 結尾加入特殊符號的 End-Of-Token。以 Llama 3-8B 為教師模型進行實驗,學生模型 Transformer 層參數約為 12.8 億(計入詞表後 Token 學生模型約 18.1 億,Byte 學生模型約 12.8 億)。 根據縮放定律預測,End-Of-Token 方案的下游平均準確率上限達 52.4%,較傳統 Token 蒸餾(48.4%)高出 4 個百分點。在相同預算下,End-Of-Token 處理的文本量約為 Token 方案的六分之一,儲存量僅需 Token 方案(保留 top-600)的五分之一。然而,End-Of-Token 處理同等文本量的訓練計算量,較普通位元組模型高約 30.94%。 此外,據《The Information》報導,為回應外界對攝錄功能的隱私審查,Meta 計畫於秋季推出代號「Luna」的無鏡頭智慧眼鏡。該裝置內建 6 枚麥克風,支援語音喚醒 Meta AI 與消費者智慧體 Muse,鏡框側邊設有快捷鍵,預計於 Connect 開發者大會正式發表,並於 10 月展開出貨。
讀原始報導

背景

大型語言模型在進行知識蒸餾時,通常以 Token 為單位,但龐大的詞表會帶來極高的儲存與運算成本。為此,Meta FAIR 與華盛頓大學提出將學習單位轉換為位元組(Byte),並透過借鑒機率論中邊際分佈(Marginal distribution)概念的 Marginalize-It 等方案,將教師模型的機率分佈轉換至位元組級別。

來源

本期分類