# EmbeddingGemma 2：功能、参数及使用指南

作者：Schnalz.net · 2026年10月7日

https://schnalz.net/zh-CN/ai-guides/embeddinggemma-2-features-specs-and-how-to-use-it

> EmbeddingGemma 2 是 Google DeepMind 推出的一款轻量级开源多模态嵌入模型，可将文本、代码、图像、音频和视频映射到单个空间中。

## 重点

- EmbeddingGemma 2 是一款基于宽松的 Apache 2.0 许可证发布的开源模型。
- 它将文本、代码、图像、音频和视频统一在共享的嵌入空间中。
- 该模型可在设备本地运行，最低仅需 191 MB 内存。
- 开发人员可将输出向量从 768 维截断至 128 维以节省空间。

## 什么是 EmbeddingGemma 2？

EmbeddingGemma 2 是由 Google DeepMind 开发的开源、轻量级多模态嵌入模型。它于 2026 年 10 月 6 日发布，可将文本、图像、音频、视频和代码的组合映射到单个统一的嵌入空间中。

该模型建立在原版纯文本模型成功的基础之上，原版模型的下载量已超过 2000 万次。它旨在消费级硬件上高效运行，使开发人员能够构建快速、离线的搜索引擎和注重隐私的 AI 应用程序。

**EmbeddingGemma 2 一览**

- **开发商**：Google DeepMind
- **发布日期**：6 October 2026
- **许可证**：Apache 2.0
- **总参数量**：740 Million
- **上下文窗口**：8,000 tokens
- **基础架构**：Gemma 4

## EmbeddingGemma 2 有哪些核心功能？

EmbeddingGemma 2 提供了强大的多模态功能，同时体积足够小，可以完全在本地设备上运行。与第一版模型相比，它引入了几项重大的效率提升。

- **8K** Token 上下文窗口
- **~191MB** 纯文本权重所需的内存
- **~567MB** 完整模型所需的内存
- **6x** 通过 MRL 实现的最大存储减少

该模型采用模块化设计，这意味着您无需一次性加载所有编码器。纯文本工作负载需要 2.7 亿个参数，并提供可选的视觉（1.7 亿）和音频（3 亿）编码器。

利用俄罗斯套娃表示学习 (Matryoshka Representation Learning)，开发人员可以动态地将输出向量从 768 维截断至 512、256 或 128 维。这种灵活性使本地数据库存储和活动内存使用量减少了高达 6 倍。

扩展后的上下文窗口允许模型直接在本地硬件上处理长达 5.5 分钟的音频、29 张图像或 58 帧视频。量化后，它可以在 Google Pixel 11 Pro 等移动硬件上流畅运行。

## EmbeddingGemma 2 在基准测试中的表现如何？

EmbeddingGemma 2 在多项语言、视觉和音频任务中，在 10 亿以下参数的模型中取得了顶尖成绩。根据 Google DeepMind 的说法，该模型的表现与几款体积更大的专用模型持平或更胜一筹。

该模型在处理编程语言方面表现出重大改进。与前代产品相比，它在 Massive Text Embedding Benchmark (MTEB) Code 数据集上的得分提高了 9.92 分。

**MTEB Code 基准测试得分（10 亿以下参数模型）**

- EmbeddingGemma 1：68.76 Score
- EmbeddingGemma 2：78.68 Score

## EmbeddingGemma 2 的最佳应用场景是什么？

EmbeddingGemma 2 专为端侧索引、搜索和检索管道而构建。在本地处理嵌入使开发人员能够保持严格的数据隐私并消除网络延迟。

由于它与 Gemma 4 共享同一个文本分词器和音频编码器，开发人员可以在同一个统一管道中同时运行这两个模型。这种组合使您能够以更低的内存占用构建本地检索增强生成 (RAG) 管道。

**适合**

- 媒体库的离线搜索
- 端侧 RAG 管道
- 本地代码库索引
- 隐私优先的移动应用程序

**不太适合**

- 超过 5.5 分钟的极长音频文件
- 直接生成文本或代码（它仅输出嵌入）

## 如何获取并使用 EmbeddingGemma 2？

开发人员可以轻松获取 EmbeddingGemma 2 的权重，以构建本地跨平台应用程序。Google DeepMind 已与生态系统合作伙伴合作，确保与热门 AI 框架的即时兼容性。

> **完成后**：通过遵循以下设置选项，您便可以直接在消费级设备上实现私密、离线的多模态搜索和索引。

1. 从 Hugging Face 或 Kaggle 下载模型权重。如需获取专为本地硬件优化的模型，请访问 Hugging Face 上的 LiteRT 社区。
2. 选择端侧部署框架。使用 Google AI Edge MediaPipe 进行快速嵌入、检索和决策任务，或使用 LiteRT 进行自定义模型集成。
3. 使用您偏好的开发工具在本地部署模型，例如 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 或 LMStudio。
4. 使用 Qdrant 等本地向量数据库来存储生成的嵌入向量。
5. 如果您需要针对特定的业务数据自定义模型，请遵循 Unsloth 提供的微调指南。

## 常见问题

### 什么是 EmbeddingGemma 2？

EmbeddingGemma 2 是由 Google DeepMind 开发的开源、轻量级多模态嵌入模型。它将文本、代码、图像、音频和视频映射到单个统一的嵌入空间中，用于本地搜索和检索。

### EmbeddingGemma 2 使用什么许可证？

EmbeddingGemma 2 是基于允许商业用途的 Apache 2.0 许可证发布的。该许可证允许开发人员和企业在商业应用中自用、修改和分发该模型。

### EmbeddingGemma 2 需要多少内存？

在 Google Pixel 11 Pro 上，EmbeddingGemma 2 的量化版本在处理纯文本权重时需要大约 191 MB 的活动内存。完整的多模态模型则需要大约 567 MB 的活动内存。

### EmbeddingGemma 2 的上下文窗口大小是多少？

EmbeddingGemma 2 拥有 8,000 个 token 的上下文窗口，比上一代大四倍。这种上下文容量允许模型在本地处理长达 5.5 分钟的音频、29 张图像或 58 帧视频。

### 我可以离线运行 EmbeddingGemma 2 吗？

可以，EmbeddingGemma 2 已针对在消费级硬件上进行本地、端侧运行进行了优化。在本地生成嵌入可确保数据隐私、实现离线操作并消除网络延迟。

## 资料来源

- [Google：EmbeddingGemma 2 is a best-in-class open model for natively multimodal embeddings](https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/)
- [Google：EmbeddingGemma 2 is a best-in-class open model for natively multimodal embeddings](https://blog.google/innovation-and-ai/technology/developers-tools/embeddinggemma-2/?utm_source=deepmind.google&utm_medium=referral&utm_campaign=gdm&utm_content=)
