谷歌 EmbeddingGemma 2:端侧多模态嵌入模型

谷歌正式推出开源嵌入模型 EmbeddingGemma 2,将能力从文本扩展至代码、图像、视频与音频,可将这些内容统一映射到同一个嵌入空间。该模型基于 Gemma 4 架构开发,采用商业友好的 Apache 2.0 许可,总参数为 7.4 亿,非常适合在端侧设备上进行推理。

去年发布的初代 EmbeddingGemma 已为开发者提供轻量且高质量的文本嵌入方案,下载量超过 2000 万次,广泛应用于端侧搜索工具与隐私优先的检索增强生成(RAG)管线。新一代产品则基于 Gemini 嵌入模型的同源技术打造。

同等规模下的领先表现

在子 10 亿参数的多模态嵌入模型中,EmbeddingGemma 2 于 MTEB Code、MAEB 等基准测试中取得领先分数,性能比肩甚至超越不少参数规模更大的模型。其采用模块化设计:纯文本任务仅需 2.7 亿参数,开发者可按需叠加 1.7 亿参数的视觉编码器与 3 亿参数的音频编码器,从而获得完整的多模态支持。

存储方面,借助 Matryoshka 表示学习(MRL),开发者能够将输出向量从 768 维动态截断至 512、256 或 128 维,使本地向量数据库的存储与内存占用最高缩减 6 倍。

端侧运行门槛大幅降低

在资源受限的条件下,EmbeddingGemma 2 仍能高效运行。经过量化后,在谷歌 Pixel 11 Pro 设备上,纯文本权重仅需约 191 MB 运行内存,完整多模态模型约需 567 MB。

该模型配备 8K 词元(Token)的上下文窗口,比初代产品扩大 4 倍,可在本地硬件上直接处理最长 5.5 分钟的音频、29 张图像、58 个视频帧,或上述内容的任意交错组合。在代码任务上,其性能较初代显著提升 9.92 分,MTEB Code 测试分数由 68.76 上升至 78.68,适合本地代码库索引、语义代码搜索与编程智能体检索。

多平台部署路径

开发者可在 Hugging Face 与 Kaggle 下载模型权重,随后也将登陆 Gemini Enterprise Agent Platform 的 Model Garden。通过 Google AI Edge 的 MediaPipe,可开发跨平台应用,或使用 LiteRT 进行自定义集成;该模型同时支持 transformers.js、WebGPU 等浏览器端方案,并兼容 transformers、Ollama、LMStudio 等常用开发工具。

EmbeddingGemma 2 将嵌入能力直接带到端侧硬件,本地生成嵌入既能保障数据隐私、降低管线延迟,也支持开发者搭建完全离线运行的跨模态搜索与检索系统。配合 Gemma 4 等生成模型,还可实现理解复杂多模态数据的端侧 RAG 管线。