
继去年推出 EmbeddingGemma 后,谷歌正式发布其升级版 EmbeddingGemma 2。该模型将能力从纯文本扩展至代码、图像、视频和音频,所有模态统一于共享嵌入空间。EmbeddingGemma 2 基于 Gemma 4 架构构建,拥有 7.4 亿参数,采用商业友好的 Apache 2.0 许可证开源,专为消费级硬件上的设备端推理设计。
凭借超过 2000 万次的下载量,初代模型已被广泛用于驱动智能设备端搜索及隐私优先的检索增强生成(RAG)管道。新一代模型不仅继承了这一优势,更通过单一原生多模态模型,实现了如“通过语音备忘录查找视频片段”或“基于文本搜索长录音”等复杂跨模态任务。
核心特性与技术优势
EmbeddingGemma 2 沿用与 Gemini 嵌入模型相同的技术底座,具备以下关键特性:
- 同级最优性能:在 MTEB Code 和 MAEB 等基准测试中,其表现位居参数量低于 10 亿的多模态嵌入模型前列。在文本、视觉和音频任务上,其性能匹配甚至超越了许多规模更大的模型。
- 模块化架构:纯文本任务仅需激活 2.7 亿参数;可选配 1.7 亿参数的视觉编码器和 3 亿参数的音频编码器,以灵活支持完整的多模态功能。
- 高效存储:引入嵌套表示学习(MRL),支持将输出向量维度从 768 动态截断至 512、256 或 128。此举可为本地向量数据库带来高达 6 倍的存储缩减。
- 端侧极致优化:经量化处理后,在 Google Pixel 11 Pro 上,纯文本权重活跃内存仅约 191MB,全多模态模型也仅需约 567MB,适合在严格资源限制下运行。
- 长上下文支持:上下文窗口扩充至 8K token(较前代提升四倍),可本地处理长达 5.5 分钟的音频、29 张图像、58 个视频帧或其交错组合。
多模态质量突破与端侧应用
在保持强大多语言文本性能的同时,EmbeddingGemma 2 的代码处理能力显著跃升,MTEB Code 基准得分从 68.76 提高至 78.68,极大提升了本地代码库索引和语义搜索的效率。在图像、视频和音频领域,它树立了子 10 亿参数模型的“每参数质量”新标杆,部分表现甚至优于两倍规模的专用模型。
该模型专为边缘硬件打造,本地生成嵌入不仅保障数据隐私、降低延迟,还赋予开发者构建完全离线跨模态搜索系统的能力。当与 Gemma 4 等生成式模型协同工作时,由于共享文本 tokenizer 和音频编码器,两者可在统一管道中运行,进一步降低总内存占用,赋能设备端 RAG 应用。
典型应用场景包括:基于语义相似度的媒体库检索、视频时刻定位、本地文件检索结合上下文推理,以及通过 MediaPipe Decision Task API 构建实时多模态决策引擎。
生态支持与部署
目前,开发者可通过 Hugging Face 和 Kaggle 下载模型权重,针对设备端优化的版本已在 LiteRT Community 上线,Gemini Enterprise Agent Platform Model Garden 也将随后支持。部署方面,支持使用 Google AI Edge MediaPipe 进行跨平台开发,或通过 LiteRT、transformers.js 及 WebGPU 构建浏览器端应用。此外,模型兼容 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 等主流框架,并支持通过 Unsloth 进行微调以适应特定用例。