跳到正文
原文
Google DeepMind·· 2 小時前精選AI 評分70

Google DeepMind 發佈開放、輕量級多模態嵌入模型 EmbeddingGemma 2

EmbeddingGemma 2: an open, lightweight multimodal embedding model

AI 導讀

Google DeepMind 發佈 EmbeddingGemma 2,將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,供裝置端推理使用。

推薦理由

EmbeddingGemma 2 將文字、程式碼、圖像、影片及音訊映射至同一嵌入空間,並列出裝置端記憶體與向量儲存數據,方便評估跨模態搜尋的本地部署。

正文 · 繁體中文

2026年10月06日

|

EmbeddingGemma 2 是能力最強的裝置端多模態嵌入向量模型,能原生地將文字、圖片、音訊及影片的組合映射至統一的嵌入空間。


Sahil Dua

Google DeepMind 研究工程師

Henrique Schechter Vera

Google DeepMind 研究工程師


EmbeddingGemma 2

聆聽文章

[[duration]] 分鐘

此內容由 Google AI 生成。生成式 AI 屬實驗性技術

我們去年推出了 EmbeddingGemma,提供輕量級的高品質文字嵌入向量選擇,協助應用程式直接在消費級硬件上整理、搜尋及連結資訊。開發者社羣的反應遠超我們預期。下載量超過 2,000 萬次,開發者已用它打造更智能的裝置端搜尋工具,以及以私隱為先的檢索增強生成(RAG)流程。

今天,我們推出 EmbeddingGemma 2,將功能擴展至文字以外,讓程式碼、圖片、影片及音訊都能共享同一嵌入空間。EmbeddingGemma 2 採用 Gemma 4 架構,並以對商業用途限制寬鬆的 Apache 2.0 授權條款發布,擁有 7.4 億個參數,適合在裝置端進行推理。它能協助用戶透過語音備忘錄尋找特定影片片段,或根據文字查詢搜尋數小時的音訊錄音;所有處理工作均由單一原生多模態模型完成。

EmbeddingGemma 2 採用與 Gemini Embedding 模型相同的技術,具備以下特點:

  • 同等規模中表現最佳:以其規模而言,在 MTEB(Massive Text Embedding Benchmark)Code 和 MAEB(Massive Audio Embedding Benchmark)等基準測試中,在參數量少於 1B 的多模態嵌入模型之中取得領先成績;在文字、視覺及音訊任務上的表現亦媲美或超越許多更大型模型。
  • 模組化設計:純文字工作負載所需參數量低至 270M,亦可選配視覺(170M)和音訊(300M)編碼器,以提供完整的多模態支援。
  • 節省儲存空間:透過 Matryoshka Representation Learning(MRL),開發者可以動態截短輸出向量,將維度由 768 降至 512、256 或 128。這可令本機向量資料庫的儲存空間及記憶體用量最多減少 6 倍。
  • 針對裝置端效能最佳化:即使資源有限,仍能高效運行。採用量化後,在 Google Pixel 11 Pro 上,純文字模型權重所需的活躍 RAM 最低為 ~191MB,完整多模態模型則最低為 ~567MB。
  • 支援更長上下文:具備 8K token 上下文視窗(比 EmbeddingGemma 1 大 4 倍),可直接在本機硬件上處理長達 5.5 分鐘的音訊、29 張圖片、58 個影片影格,或上述內容的交錯組合。

在程式碼、視覺及音訊方面達到頂尖品質

EmbeddingGemma 2 保持了 EmbeddingGemma 出色的多語言文字表現,程式碼表現則大幅提升 9.92 分(MTEB Code 評分由 68.76 升至 78.68),因此適合用於本機程式碼庫索引、程式碼語意搜尋及編碼 Agent 檢索。在圖片、影片、文件及音訊方面,它為參數量少於 1B 的模型樹立每參數品質的新標準,甚至勝過一些參數量超過其兩倍的專用模型。

Massive Text Embedding Benchmark (Code)

Massive Image Embedding Benchmark (Lite)

Massive Audio Embedding Benchmark

完整評估指標及模型資訊請參閲 EmbeddingGemma 2 模型卡片。

全面在裝置端實現語意搜尋、路由及檢索

EmbeddingGemma 2 將強大功能直接帶到邊緣硬件上。在本機生成嵌入向量有助保障資料私隱、縮短管線延遲,並讓開發者建立可完全離線運作的跨模態搜尋及檢索系統。

配合 Gemma 4 等生成式模型使用時,EmbeddingGemma 2 可在裝置上建構 RAG 管線,以理解複雜的多模態資料。由於 EmbeddingGemma 2 以 Gemma 4 為基礎構建,並共用其文字分詞器和音訊編碼器,開發者可以在統一管線中同時執行兩個模型,降低兩者合計的整體記憶體佔用。

如要了解如何使用 LiteRT 建構裝置端搜尋和 RAG 系統,請參閲 Google AI Edge 網誌文章。

開始使用 EmbeddingGemma 2

我們與以下合作夥伴緊密合作,確保 EmbeddingGemma 2 可在你進行開發的平台上開箱即用:

  • 下載模型:在 Hugging Face 和 Kaggle 上取得模型權重;模型即將於 Gemini Enterprise Agent Platform Model Garden 上架。如需適用於裝置端的最佳化模型,請瀏覽 Hugging Face 上的 LiteRT Community。
  • 裝置端部署:使用 Google AI Edge MediaPipe 開發跨平台應用程式,輕鬆完成嵌入、檢索及決策任務;或使用 LiteRT 整合自訂模型。使用 transformers.js 或 WebGPU 開發瀏覽器應用程式。
  • 使用你慣用的開發工具:透過 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio,高效提供模型服務。使用 Qdrant 儲存嵌入向量。
  • 微調:參閲 Unsloth 的指引,瞭解如何針對你的使用情境微調 EmbeddingGemma 2。

參閲我們的開發者指南、文件,以及推理和微調指南。

來源:Google DeepMind · deepmind.google