跳到主要內容
2026-10-07 日報
模型發布

Google 發布 EmbeddingGemma 2 多模態嵌入模型:740M 參數支援圖文音影,採 Apache 2.0 開源

Google DeepMind綜合 3 家報導一手來源
核實資料不足

來源為發布方或研究資料;不代表所有主張已獲獨立核實。

本次未取得足夠原文證據

Google DeepMind 發布 EmbeddingGemma 2,採 Apache 2.0 授權開源。該模型基於 Gemma 4 架構,總參數為 740M,能將文字(含程式碼)、圖像、影片與音訊映射至統一的 768 維向量空間。 模型採模組化設計,包含 270M 文字模型、170M 視覺編碼器與 300M 音訊編碼器。其上下文視窗達 8K token(為前代 4 倍),可直接在本地硬體處理長達 5.5 分鐘音訊、29 張圖片或 58 幀影片。 針對終端設備最佳化,量化後在 Google Pixel 11 Pro 上,純文字權重僅需約 191MB 活躍記憶體,完整多模態模型需約 567MB。據 The Decoder 報導,透過 WebGPU 在瀏覽器執行,每次查詢約需 20 到 70 毫秒。 該模型支援 Matryoshka 表示學習(MRL),開發者可將輸出向量從 768 維動態截斷至 512、256 或 128 維,最高減少 6 倍本地向量資料庫儲存與記憶體使用。 效能方面,在 MTEB Code 基準測試中得分從 68.76 提升至 78.68。官方稱其在 1B 參數以下的多模態嵌入模型中得分領先,並超越部分體積兩倍大的專用模型。由於與 Gemma 4 共享文字 tokenizer 與音訊編碼器,兩者可合併部署以降低總記憶體佔用,實現完全離線的 RAG 應用。
讀原始報導

背景

檢索增強生成(RAG)是一種讓大型語言模型能從外部資料源擷取資訊來回應查詢的技術。Google 先前推出的第一代 EmbeddingGemma,在 MTEB 基準測試中是 5 億參數以下排名最高的開源多語言文字嵌入模型。

來源