跳到主要內容
2026-09-28 日報
研究與評測

研究揭示無編碼器 MLLM 縮放定律:算力達 10^22 FLOPs 即可追平傳統視覺編碼器架構

HF Daily Papers一手來源
核實資料不足

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

本次未取得足夠原文證據

最新研究探討了無編碼器(Encoder-Free)多模態大型語言模型(MLLMs)的縮放定律(Scaling Laws)。傳統 MLLM 多依賴預訓練視覺編碼器提供視覺先驗,而無編碼器架構則直接從原始像素學習。 研究團隊比較兩種架構後得出三項主要發現: 1. 移除視覺編碼器會將多模態任務的最佳算力分配推向更大的模型,但對純文字任務的分配幾乎沒有影響。 2. 兩種架構在文字任務上的損失與算力邊界(loss-compute frontiers)幾乎重合;在多模態任務上,無編碼器模型在小規模時表現較差,但預測在算力達到 10^22 FLOPs(位於實際預訓練預算範圍內)時即可追平傳統架構。 3. 在缺乏視覺編碼器的情況下,語言模型會透過視覺特定適應來接管其功能:隨著訓練算力增加,視覺 token 之間的雙向互動變得更有益,視覺處理重心移向更早的網路層,且視覺 token 的專家路由(expert routing)變得更加集中。 研究結論指出,預訓練視覺編碼器所提供的優勢會隨模型規模擴大而減弱,使無編碼器架構有望成為多模態預訓練的發展方向。
讀原始報導

背景

多模態大型語言模型(MLLMs)的發展常依賴神經網路擴展定律(Neural scaling law)來預測效能。擴展定律本質上是一種冪定律(power law),描述兩個變數之間的比例關係;在神經網路中,這類定律可用於評估有效參數數量或運算量如何影響模型的損失函數(loss scaling)。

來源

本期分類
相關主題