# EmbeddingGemma 2：功能、規格及使用教學

作者：Schnalz.net · 2026年10月7日

https://schnalz.net/zh-HK/ai-guides/embeddinggemma-2-features-specs-and-how-to-use-it

> EmbeddingGemma 2 是 Google DeepMind 推出的一款輕量級開源多模態嵌入模型，能將文字、程式碼、圖片、音訊和影片對應到單一空間中。

## 重點

- EmbeddingGemma 2 是一款以寬鬆的 Apache 2.0 許可證發佈的開源模型。
- 它將文字、程式碼、圖片、音訊和影片統一在共享的嵌入空間中。
- 該模型可在裝置本地運行，最少僅需 191 MB 的 RAM。
- 開發人員可將輸出向量從 768 維截斷至 128 維以節省空間。

## 什麼是 EmbeddingGemma 2？

EmbeddingGemma 2 是由 Google DeepMind 開發的開源、輕量級多模態嵌入模型。它於 2026 年 10 月 6 日發佈，能將文字、圖片、音訊、影片和程式碼的組合對應到單一且統一的嵌入空間中。

此模型建立在原版純文字模型的成功基礎之上，原版模型的下載量已超過 2,000 萬次。它旨在消費級硬件上高效運行，讓開發人員能夠構建快速、離線的搜尋引擎和注重私隱的 AI 應用程式。

**EmbeddingGemma 2 一覽**

- **開發商**：Google DeepMind
- **發佈日期**：6 October 2026
- **許可證**：Apache 2.0
- **總參數群**：740 Million
- **上下文窗口**：8,000 tokens
- **基礎架構**：Gemma 4

## EmbeddingGemma 2 有哪些關鍵功能？

EmbeddingGemma 2 提供了強大的多模態功能，同時體積足夠小，可以完全在本地裝置上運行。與第一版模型相比，它引入了幾項重大的效率提升。

- **8K** Token 上下文窗口
- **~191MB** 純文字權重所需的 RAM
- **~567MB** 完整模型所需的 RAM
- **6x** 透過 MRL 實現的最大存儲減少

該模型採用模組化設計，這意味著您無需一次過載入所有編碼器。純文字工作負載需要 2.7 億個參數，並提供選配的視覺（1.7 億）和音訊（3 億）編碼器。

利用 Matryoshka Representation Learning (MRL)，開發人員可以動態地將輸出向量從 768 維截斷至 512、256 或 128 維。這種靈活性使本地數據庫存儲和活動記憶體使用量減少了高達 6 倍。

擴展後的上下文窗口允許模型直接在本地硬件上處理長達 5.5 分鐘的音訊、29 張圖片或 58 幀影片。量化後，它可以在 Google Pixel 11 Pro 等流動硬件上流暢運行。

## EmbeddingGemma 2 在基準測試中的表現如何？

EmbeddingGemma 2 在多項語言、視覺和音訊任務中，於 10 億以下參數的模型中取得了頂尖成績。根據 Google DeepMind 的說法，該模型的表現與幾款體積更大的專用模型持平或更勝一籌。

該模型在處理程式語言方面表現出重大改進。與前代產品相比，它在 Massive Text Embedding Benchmark (MTEB) Code 數據集上的得分提高了 9.92 分。

**MTEB Code 基準測試得分（10 億以下參數模型）**

- EmbeddingGemma 1：68.76 Score
- EmbeddingGemma 2：78.68 Score

## EmbeddingGemma 2 的最佳應用場景是什麼？

EmbeddingGemma 2 專為裝置端索引、搜尋和檢索管道而構建。在本地處理嵌入可讓開發人員保持嚴格的數據私隱並消除網絡延遲。

由於它與 Gemma 4 共享同一個文字分詞器和音訊編碼器，開發人員可以在同一個統一管道中同時運行這兩個模型。這種組合使您能夠以更低的記憶體佔用構建本地檢索增強生成 (RAG) 管道。

**適合**

- 媒體庫的離線搜尋
- 裝置端 RAG 管道
- 本地程式碼庫索引
- 私隱優先的流動應用程式

**不太適合**

- 超過 5.5 分鐘的極長音訊檔案
- 直接生成文字或程式碼（它僅輸出嵌入）

## 如何獲取並使用 EmbeddingGemma 2？

開發人員可以輕鬆獲取 EmbeddingGemma 2 的權重，以構建本地跨平台應用程式。Google DeepMind 已與生態系統合作夥伴合作，確保與熱門 AI 框架的即時相容性。

> **完成後**：透過遵循以下設置選項，您便可以直接在消費級裝置上實現私密、離線的多模態搜尋和索引。

1. 從 Hugging Face 或 Kaggle 下載模型權重。若要獲取專為本地硬件優化的模型，請瀏覽 Hugging Face 上的 LiteRT 社群。
2. 選擇裝置端部署框架。使用 Google AI Edge MediaPipe 進行快速嵌入、檢索和決策任務，或使用 LiteRT 進行自定義模型集成。
3. 使用您偏好的開發工具在本地部署模型，例如 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 或 LMStudio。
4. 使用 Qdrant 等本地向量數據庫來存儲生成的嵌入向量。
5. 如果您需要針對特定的業務數據自定義模型，請遵循 Unsloth 提供的微調指南。

## 常見問題

### 什麼是 EmbeddingGemma 2？

EmbeddingGemma 2 是由 Google DeepMind 開發的開源、輕量級多模態嵌入模型。它將文字、程式碼、圖片、音訊和影片對應到單一且統一的嵌入空間中，用於本地搜尋和檢索。

### EmbeddingGemma 2 使用什麼許可證？

EmbeddingGemma 2 是以允許商業用途的 Apache 2.0 許可證發佈的。該許可證允許開發人員和企業在商業應用中自用、修改和分發該模型。

### EmbeddingGemma 2 需要多少 RAM？

在 Google Pixel 11 Pro 上，EmbeddingGemma 2 的量化版本在處理純文字權重時需要大約 191 MB 的活動 RAM。完整的多模態模型則需要大約 567 MB 的活動 RAM。

### EmbeddingGemma 2 的上下文窗口大小是多少？

EmbeddingGemma 2 擁有 8,000 個 token 的上下文窗口，比上一代大四倍。這種上下文容量允許模型在本地處理長達 5.5 分鐘的音訊、29 張圖片或 58 幀影片。

### 我可以離線運行 EmbeddingGemma 2 嗎？

可以，EmbeddingGemma 2 已針對在消費級硬件上進行本地、裝置端運行進行了優化。在本地生成嵌入可確保數據私隱、實現離線操作並消除網絡延遲。

## 資料來源

- [Google：EmbeddingGemma 2 is a best-in-class open model for natively multimodal embeddings](https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/)
- [Google：EmbeddingGemma 2 is a best-in-class open model for natively multimodal embeddings](https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=)
