[控场AI]
· 6 分钟阅读· 3,444 字

EmbeddingGemma 2发布:端侧多模态嵌入模型新标杆

EmbeddingGemma 2发布:端侧多模态嵌入模型新标杆

Google DeepMind 发布 EmbeddingGemma 2,7.4 亿参数即可在手机端实现跨文本、代码、图像、音频和视频的统一语义检索。

Google DeepMind 推出的 EmbeddingGemma 2 是一款面向端侧部署的原生多模态嵌入模型,基于 Gemma 4 架构,仅凭 7.4 亿参数便能将文本、代码、图像、音频和视频映射到同一嵌入空间,支持跨模态语义检索。模型采用模块化设计,纯文本任务最低只需 2.7 亿参数,视觉与音频编码器可按需加载;借助 MRL 技术,输出向量可从 768 维压缩至 128 维,带来最高 6 倍的存储节省。量化后完整多模态模型在 Pixel 11 Pro 上仅占约 567MB 内存,真正实现了手机常驻运行。相较初代,代码理解能力在 MTEB Code 基准上提升近 10 分,同时支持 8K token 上下文以处理长音频或多图输入。以 Apache 2.0 许可证开源,兼容 Hugging Face、Ollama、llama.cpp 等主流工具链,为隐私优先的本地 RAG 和跨模态搜索应用提供了高性价比的基础设施。

Google DeepMind 推出 EmbeddingGemma 2,将嵌入模型的能力从纯文本扩展到代码、图像、视频和音频,并将这一切压缩进一个仅 7.4 亿参数、可在手机上运行的模型中。这标志着端侧 AI 检索能力的一次重要跨越。

EmbeddingGemma 2: an open, lightweight multimodal embedding model

从文本到多模态的跨越

去年发布的初代 EmbeddingGemma 定位是轻量级高质量文本嵌入方案,帮助开发者在消费级硬件上直接完成信息组织、搜索与连接。它的市场反响超出预期——下载量突破 2000 万次,被广泛用于智能端侧搜索工具和注重隐私的检索增强生成(RAG)流水线。

EmbeddingGemma 2 的核心升级在于「原生多模态」。它基于 Gemma 4 架构构建,采用商业友好的 Apache 2.0 许可证发布,能够将文本、代码、图像、音频和视频映射到同一个统一的嵌入空间。这意味着开发者可以用一段语音备忘录找到特定的视频片段,或用一句文本查询在数小时的录音中定位内容,而这一切都由单个模型原生处理,无需拼接多个专用模型。

「统一嵌入空间」是多模态检索的核心概念。嵌入(Embedding)是将不同内容映射为高维数值向量的过程,向量之间的距离反映语义相似度。单模态模型只能比较同类内容(文本 vs 文本),而多模态模型将不同模态的内容投影到同一坐标系中,使「一段文字描述」与「一帧视频画面」可以直接计算相似度。检索增强生成(RAG)则是一种常见的 AI 应用架构:在生成回答之前,先用嵌入模型从知识库中检索出相关片段,再将其作为上下文喂给生成模型,从而降低幻觉、提升回答的准确性和时效性。端侧 RAG 的特殊价值在于整个检索过程无需联网,数据不离开设备,对隐私敏感场景尤为重要。

模块化设计与存储效率

EmbeddingGemma 2 延续了 Gemini Embedding 系列的技术基因,但在工程设计上做了大量针对端侧场景的优化。

按需加载的模块化架构

模型采用模块化设计:纯文本任务最低只需 2.7 亿参数即可运行,视觉编码器(1.7 亿参数)和音频编码器(3 亿参数)则作为可选组件按需启用。这种设计让开发者可以根据实际需求裁剪资源占用,避免为用不到的模态付出内存代价。

Matryoshka 表征学习带来的存储压缩

借助 Matryoshka Representation Learning(MRL)技术,开发者可以将输出向量从 768 维动态截断到 512、256 甚至 128 维。这为本地向量数据库和内存占用带来最高 6 倍的存储压缩,对于资源受限的端侧设备意义重大。

在量化之后,模型在 Google Pixel 11 Pro 上的实测表现相当惊人:纯文本权重仅需约 191MB 活跃内存,完整多模态模型也只需约 567MB。这样的占用让它真正具备了在手机端常驻运行的可行性。

Matryoshka Representation Learning(MRL)是一种受俄罗斯套娃玩具启发的向量训练技术。传统嵌入模型输出固定维度的向量,使用时必须保留完整维度;而 MRL 在训练阶段同时优化多个维度截断后的子向量,使得同一模型输出的向量可以在不同精度需求下按需裁剪。例如,一个 768 维向量的前 128 维本身就是一个质量可接受的独立嵌入,前 256 维则质量更高,以此类推。这种「嵌套」结构让开发者可以在存储空间、检索速度与检索精度之间灵活权衡:对候选集做粗排时用低维向量快速筛选,精排时再切换到高维向量验证相关性。存储压缩比与维度缩减比例线性相关,从 768 维降至 128 维恰好是 6 倍,这也与文中所述的「最高 6 倍存储压缩」直接对应。

性能表现:以小搏大

EmbeddingGemma 2 在保持与初代相当的多语言文本能力的同时,代码理解能力实现了显著跃升。在 MTEB Code 基准上,其得分从 68.76 提升至 78.68,提升幅度达 9.92 分。这一进步使其非常适合本地代码库索引、语义代码搜索以及编程智能体的检索场景。

在图像、视频、文档和音频等多个维度,EmbeddingGemma 2 在十亿参数以下的模型中树立了「每参数质量」的新标准,甚至超越了部分体量两倍于它的专用模型。在 MTEB Code 和 MAEB(Massive Audio Embedding Benchmark)等基准上,它拿下了同尺寸多模态嵌入模型的领先成绩。

另一项值得关注的升级是上下文窗口。EmbeddingGemma 2 支持 8K token 上下文,是初代的 4 倍,可以在本地硬件上直接处理长达 5.5 分钟的音频、29 张图像、58 帧视频,或这些内容的交错组合。

MTEB(Massive Text Embedding Benchmark)是评估文本嵌入模型的权威综合基准,涵盖检索、分类、聚类、语义相似度等多个子任务,被业界广泛用于横向比较不同模型的能力。MTEB Code 是其专门针对代码理解的子集,测试模型对函数、注释、代码语义的理解与检索能力。MAEB(Massive Audio Embedding Benchmark)则是音频领域的对应基准,评估模型跨语音、音效、音乐等音频类型的语义表示能力。这两个基准的得分提升,直接说明 EmbeddingGemma 2 在专业领域检索任务上超越了同体量竞品,而非仅靠通用文本能力取胜。

端侧语义检索的落地场景

EmbeddingGemma 2 将强大的检索能力直接带到边缘硬件上。本地生成嵌入向量既能保障数据隐私,又能降低流水线延迟,同时让跨模态搜索完全离线运行成为可能。

当它与 Gemma 4 等生成模型配合时,可以构建理解复杂多模态数据的端侧 RAG 流水线。由于 EmbeddingGemma 2 本身基于 Gemma 4 构建,并共享其文本分词器和音频编码器,开发者能够以更低的总内存占用在统一流水线中同时运行两个模型。

Google 也提供了多个可直接体验的应用场景:

  • 在 Google AI Edge Gallery 的 Instant Media Search 中,用文本或图像在媒体库中按语义相似度查找匹配内容;
  • 在 Video Moments Finder 中,用文本或音频查询定位视频中的特定时刻;
  • 在 Google AI Edge Foresight 应用中,将 EmbeddingGemma 2 的本地文件检索与 Gemma 4 的上下文推理结合;
  • 通过 MediaPipe Decision Task API,构建利用多模态上下文的实时分类、路由与预测引擎。

如何上手

EmbeddingGemma 2 的生态支持相当完善。模型权重已在 Hugging Face 和 Kaggle 上提供,Gemini Enterprise Agent Platform Model Garden 的支持也即将到来。针对端侧优化的版本可在 Hugging Face 的 LiteRT Community 获取。

部署方面,开发者可以使用 Google AI Edge MediaPipe 实现开箱即用的嵌入、检索与决策任务,或通过 LiteRT 进行自定义集成,还能借助 transformers.js 与 WebGPU 在浏览器中运行。模型兼容 transformers、sentence-transformers、MLX、vLLM、llama.cpp、SGLang、Ollama 和 LMStudio 等主流工具链,向量存储可对接 Qdrant,微调则可参考 Unsloth 的指南。

结语

EmbeddingGemma 2 代表了端侧多模态检索的一个重要节点。它用不到 10 亿参数的体量,实现了跨文本、代码、图像、音频和视频的统一嵌入,并在保证隐私和离线能力的前提下保持了领先的性能。对于希望在消费级设备上构建搜索、RAG 和决策系统的开发者而言,这是一个兼具实用性与可访问性的开源选择。

分享:

相关推荐