- EmbeddingGemma 2 是一款以寬鬆的 Apache 2.0 許可證發佈的開源模型。
- 它將文字、程式碼、圖片、音訊和影片統一在共享的嵌入空間中。
- 該模型可在裝置本地運行,最少僅需 191 MB 的 RAM。
- 開發人員可將輸出向量從 768 維截斷至 128 維以節省空間。
本文內容
什麼是 EmbeddingGemma 2?
EmbeddingGemma 2 是由 Google DeepMind 開發的開源、輕量級多模態嵌入模型。它於 2026 年 10 月 6 日發佈,能將文字、圖片、音訊、影片和程式碼的組合對應到單一且統一的嵌入空間中。
此模型建立在原版純文字模型的成功基礎之上,原版模型的下載量已超過 2,000 萬次。它旨在消費級硬件上高效運行,讓開發人員能夠構建快速、離線的搜尋引擎和注重私隱的 AI 應用程式。
- 開發商
- Google DeepMind
- 發佈日期
- 6 October 2026
- 許可證
- Apache 2.0
- 總參數群
- 740 Million
- 上下文窗口
- 8,000 tokens
- 基礎架構
- Gemma 4
EmbeddingGemma 2 有哪些關鍵功能?
EmbeddingGemma 2 提供了強大的多模態功能,同時體積足夠小,可以完全在本地裝置上運行。與第一版模型相比,它引入了幾項重大的效率提升。
該模型採用模組化設計,這意味著您無需一次過載入所有編碼器。純文字工作負載需要 2.7 億個參數,並提供選配的視覺(1.7 億)和音訊(3 億)編碼器。
利用 Matryoshka Representation Learning (MRL),開發人員可以動態地將輸出向量從 768 維截斷至 512、256 或 128 維。這種靈活性使本地數據庫存儲和活動記憶體使用量減少了高達 6 倍。
擴展後的上下文窗口允許模型直接在本地硬件上處理長達 5.5 分鐘的音訊、29 張圖片或 58 幀影片。量化後,它可以在 Google Pixel 11 Pro 等流動硬件上流暢運行。
EmbeddingGemma 2 在基準測試中的表現如何?
EmbeddingGemma 2 在多項語言、視覺和音訊任務中,於 10 億以下參數的模型中取得了頂尖成績。根據 Google DeepMind 的說法,該模型的表現與幾款體積更大的專用模型持平或更勝一籌。
該模型在處理程式語言方面表現出重大改進。與前代產品相比,它在 Massive Text Embedding Benchmark (MTEB) Code 數據集上的得分提高了 9.92 分。
EmbeddingGemma 2 的最佳應用場景是什麼?
EmbeddingGemma 2 專為裝置端索引、搜尋和檢索管道而構建。在本地處理嵌入可讓開發人員保持嚴格的數據私隱並消除網絡延遲。
由於它與 Gemma 4 共享同一個文字分詞器和音訊編碼器,開發人員可以在同一個統一管道中同時運行這兩個模型。這種組合使您能夠以更低的記憶體佔用構建本地檢索增強生成 (RAG) 管道。
- 媒體庫的離線搜尋
- 裝置端 RAG 管道
- 本地程式碼庫索引
- 私隱優先的流動應用程式
- 超過 5.5 分鐘的極長音訊檔案
- 直接生成文字或程式碼(它僅輸出嵌入)
如何獲取並使用 EmbeddingGemma 2?
開發人員可以輕鬆獲取 EmbeddingGemma 2 的權重,以構建本地跨平台應用程式。Google DeepMind 已與生態系統合作夥伴合作,確保與熱門 AI 框架的即時相容性。
透過遵循以下設置選項,您便可以直接在消費級裝置上實現私密、離線的多模態搜尋和索引。
- 從 Hugging Face 或 Kaggle 下載模型權重。若要獲取專為本地硬件優化的模型,請瀏覽 Hugging Face 上的 LiteRT 社群。
- 選擇裝置端部署框架。使用 Google AI Edge MediaPipe 進行快速嵌入、檢索和決策任務,或使用 LiteRT 進行自定義模型集成。
- 使用您偏好的開發工具在本地部署模型,例如 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 或 LMStudio。
- 使用 Qdrant 等本地向量數據庫來存儲生成的嵌入向量。
- 如果您需要針對特定的業務數據自定義模型,請遵循 Unsloth 提供的微調指南。
常見問題
什麼是 EmbeddingGemma 2?
EmbeddingGemma 2 使用什麼許可證?
EmbeddingGemma 2 需要多少 RAM?
EmbeddingGemma 2 的上下文窗口大小是多少?
我可以離線運行 EmbeddingGemma 2 嗎?
想 AI 給出的答案是你的品牌?
免費檢查你的網站對 ChatGPT、Gemini 與 Perplexity 準備得有多好,約十秒完成。