AI 新發佈 ·

EmbeddingGemma 2:功能、規格及使用教學

EmbeddingGemma 2 是 Google DeepMind 推出的一款輕量級開源多模態嵌入模型,能將文字、程式碼、圖片、音訊和影片對應到單一空間中。

重點
  • EmbeddingGemma 2 是一款以寬鬆的 Apache 2.0 許可證發佈的開源模型。
  • 它將文字、程式碼、圖片、音訊和影片統一在共享的嵌入空間中。
  • 該模型可在裝置本地運行,最少僅需 191 MB 的 RAM。
  • 開發人員可將輸出向量從 768 維截斷至 128 維以節省空間。
本文內容
  1. 什麼是 EmbeddingGemma 2?
  2. EmbeddingGemma 2 有哪些關鍵功能?
  3. EmbeddingGemma 2 在基準測試中的表現如何?
  4. EmbeddingGemma 2 的最佳應用場景是什麼?
  5. 如何獲取並使用 EmbeddingGemma 2?
  6. 常見問題

什麼是 EmbeddingGemma 2?

EmbeddingGemma 2 是由 Google DeepMind 開發的開源、輕量級多模態嵌入模型。它於 2026 年 10 月 6 日發佈,能將文字、圖片、音訊、影片和程式碼的組合對應到單一且統一的嵌入空間中。

此模型建立在原版純文字模型的成功基礎之上,原版模型的下載量已超過 2,000 萬次。它旨在消費級硬件上高效運行,讓開發人員能夠構建快速、離線的搜尋引擎和注重私隱的 AI 應用程式。

EmbeddingGemma 2 一覽
開發商
Google DeepMind
發佈日期
6 October 2026
許可證
Apache 2.0
總參數群
740 Million
上下文窗口
8,000 tokens
基礎架構
Gemma 4

EmbeddingGemma 2 有哪些關鍵功能?

EmbeddingGemma 2 提供了強大的多模態功能,同時體積足夠小,可以完全在本地裝置上運行。與第一版模型相比,它引入了幾項重大的效率提升。

8KToken 上下文窗口
~191MB純文字權重所需的 RAM
~567MB完整模型所需的 RAM
6x透過 MRL 實現的最大存儲減少

該模型採用模組化設計,這意味著您無需一次過載入所有編碼器。純文字工作負載需要 2.7 億個參數,並提供選配的視覺(1.7 億)和音訊(3 億)編碼器。

利用 Matryoshka Representation Learning (MRL),開發人員可以動態地將輸出向量從 768 維截斷至 512、256 或 128 維。這種靈活性使本地數據庫存儲和活動記憶體使用量減少了高達 6 倍。

擴展後的上下文窗口允許模型直接在本地硬件上處理長達 5.5 分鐘的音訊、29 張圖片或 58 幀影片。量化後,它可以在 Google Pixel 11 Pro 等流動硬件上流暢運行。

EmbeddingGemma 2 在基準測試中的表現如何?

EmbeddingGemma 2 在多項語言、視覺和音訊任務中,於 10 億以下參數的模型中取得了頂尖成績。根據 Google DeepMind 的說法,該模型的表現與幾款體積更大的專用模型持平或更勝一籌。

該模型在處理程式語言方面表現出重大改進。與前代產品相比,它在 Massive Text Embedding Benchmark (MTEB) Code 數據集上的得分提高了 9.92 分。

EmbeddingGemma 2 的最佳應用場景是什麼?

EmbeddingGemma 2 專為裝置端索引、搜尋和檢索管道而構建。在本地處理嵌入可讓開發人員保持嚴格的數據私隱並消除網絡延遲。

由於它與 Gemma 4 共享同一個文字分詞器和音訊編碼器,開發人員可以在同一個統一管道中同時運行這兩個模型。這種組合使您能夠以更低的記憶體佔用構建本地檢索增強生成 (RAG) 管道。

適合
  • 媒體庫的離線搜尋
  • 裝置端 RAG 管道
  • 本地程式碼庫索引
  • 私隱優先的流動應用程式
不太適合
  • 超過 5.5 分鐘的極長音訊檔案
  • 直接生成文字或程式碼(它僅輸出嵌入)

如何獲取並使用 EmbeddingGemma 2?

開發人員可以輕鬆獲取 EmbeddingGemma 2 的權重,以構建本地跨平台應用程式。Google DeepMind 已與生態系統合作夥伴合作,確保與熱門 AI 框架的即時相容性。

完成後

透過遵循以下設置選項,您便可以直接在消費級裝置上實現私密、離線的多模態搜尋和索引。

  1. 從 Hugging Face 或 Kaggle 下載模型權重。若要獲取專為本地硬件優化的模型,請瀏覽 Hugging Face 上的 LiteRT 社群。
  2. 選擇裝置端部署框架。使用 Google AI Edge MediaPipe 進行快速嵌入、檢索和決策任務,或使用 LiteRT 進行自定義模型集成。
  3. 使用您偏好的開發工具在本地部署模型,例如 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 或 LMStudio。
  4. 使用 Qdrant 等本地向量數據庫來存儲生成的嵌入向量。
  5. 如果您需要針對特定的業務數據自定義模型,請遵循 Unsloth 提供的微調指南。

常見問題

什麼是 EmbeddingGemma 2?
EmbeddingGemma 2 是由 Google DeepMind 開發的開源、輕量級多模態嵌入模型。它將文字、程式碼、圖片、音訊和影片對應到單一且統一的嵌入空間中,用於本地搜尋和檢索。
EmbeddingGemma 2 使用什麼許可證?
EmbeddingGemma 2 是以允許商業用途的 Apache 2.0 許可證發佈的。該許可證允許開發人員和企業在商業應用中自用、修改和分發該模型。
EmbeddingGemma 2 需要多少 RAM?
在 Google Pixel 11 Pro 上,EmbeddingGemma 2 的量化版本在處理純文字權重時需要大約 191 MB 的活動 RAM。完整的多模態模型則需要大約 567 MB 的活動 RAM。
EmbeddingGemma 2 的上下文窗口大小是多少?
EmbeddingGemma 2 擁有 8,000 個 token 的上下文窗口,比上一代大四倍。這種上下文容量允許模型在本地處理長達 5.5 分鐘的音訊、29 張圖片或 58 幀影片。
我可以離線運行 EmbeddingGemma 2 嗎?
可以,EmbeddingGemma 2 已針對在消費級硬件上進行本地、裝置端運行進行了優化。在本地生成嵌入可確保數據私隱、實現離線操作並消除網絡延遲。

資料來源:Google · Google

想 AI 給出的答案是你的品牌?

免費檢查你的網站對 ChatGPT、Gemini 與 Perplexity 準備得有多好,約十秒完成。

延伸閱讀:原生應用程式,還是網頁應用程式?2026 年怎樣選