EmbeddingGemma 2
Google DeepMind推出的多模态嵌入模型,支持文本、代码、图像、视频和音频的向量化,适用于语义搜索、RAG、分类和聚类任务,支持100+语言
Core Facts
量化后,EmbeddingGemma 2 在 Google Pixel 11 Pro 上纯文本权重仅需约 191MB 活跃内存,完整多模态模型约需 567MB
EmbeddingGemma 2 是谷歌基于 Gemma 4 架构打造的多模态嵌入模型,能够将文本、图像、音频和视频编码到共享的 768 维向量空间中
EmbeddingGemma 2 采用 Matryoshka Representation Learning 技术,嵌入向量可被截断到 512、256 或 128 维而不会严重损失表达质量
Timeline (last 90 days)
EmbeddingGemma 2 是一个多模态检索开源模型,支持用自己的数据进行微调
作者用Gemini 3 Flash为120个视频字幕段落生成观众风格问题构成「问题—段落」数据对,训练不到三分钟后首位命中率从约三分之二提升到约四分之三
语音搜索一度掉到接近零是因为与适配器一起保存的processor把音频裁成几毫秒,修复方法是复用基础模型的processor
微调音频主干后,图片搜索和语音搜索未变化,但通用文本搜索下降约4分,这是改动共享主干的代价
将10种声音完全从训练中剔除后测试,这些未见过的声音没有改善,表明模型学的是给定标签而非通用听觉能力,不会自动泛化到未训练标签
在ESC-50数据集的声音分类实验中,训练前首位命中率约25%,在A100上训练约七分半钟后提升到约66%
EmbeddingGemma 2 的文本、图像、视频、音频共用同一个主干网络,在某一模态上训练主干会改变其他模态的表现
EmbeddingGemma 2 要求搜索查询前加简短任务提示,文档用「标题+正文」格式,训练与推理的模板必须完全一致
EmbeddingGemma 2 首次把文本、代码、图像、视频和音频统一映射到同一个嵌入空间,并针对端侧优化支持本地部署 RAG
Google DeepMind发布了Embedding Gemma 2,一个开放的多模态嵌入模型,参数量740M,将文字、图片、视频和音频映射到同一向量空间
40 more timeline events
All Facts (20)
量化后,EmbeddingGemma 2 在 Google Pixel 11 Pro 上纯文本权重仅需约 191MB 活跃内存,完整多模态模型约需 567MB
80%Partially VerifiedEmbeddingGemma 2 是谷歌基于 Gemma 4 架构打造的多模态嵌入模型,能够将文本、图像、音频和视频编码到共享的 768 维向量空间中
75%Partially VerifiedEmbeddingGemma 2 采用 Matryoshka Representation Learning 技术,嵌入向量可被截断到 512、256 或 128 维而不会严重损失表达质量
75%Partially VerifiedGoogle发布Embedding Gemma 2,是其首个面向端侧的原生多模态开放嵌入模型,仅7.4亿参数,采用Apache 2.0许可证开放权重,可在同一共享空间理解文本、代码、图像、音频和视频
75%Partially VerifiedEmbeddingGemma2除了文字和图片外还支持音频和视频,把不同模态内容都转换成768维向量
65%UnverifiedGoogle DeepMind发布了Embedding Gemma 2,一个开放的多模态嵌入模型,参数量740M,将文字、图片、视频和音频映射到同一向量空间
60%UnverifiedGoogle开源了多模态Embedding模型EmbeddingGemma2,能将文字和图片转换到同一个向量空间
60%Unverified在ESC-50数据集的声音分类实验中,训练前首位命中率约25%,在A100上训练约七分半钟后提升到约66%
50%UnverifiedEmbeddingGemma 2 的文本、图像、视频、音频共用同一个主干网络,在某一模态上训练主干会改变其他模态的表现
50%UnverifiedEmbeddingGemma 2 要求搜索查询前加简短任务提示,文档用「标题+正文」格式,训练与推理的模板必须完全一致
50%Unverified语音搜索一度掉到接近零是因为与适配器一起保存的processor把音频裁成几毫秒,修复方法是复用基础模型的processor
50%Unverified作者用Gemini 3 Flash为120个视频字幕段落生成观众风格问题构成「问题—段落」数据对,训练不到三分钟后首位命中率从约三分之二提升到约四分之三
50%Unverified将10种声音完全从训练中剔除后测试,这些未见过的声音没有改善,表明模型学的是给定标签而非通用听觉能力,不会自动泛化到未训练标签
50%UnverifiedEmbeddingGemma 2 是一个多模态检索开源模型,支持用自己的数据进行微调
50%Unverified微调音频主干后,图片搜索和语音搜索未变化,但通用文本搜索下降约4分,这是改动共享主干的代价
50%UnverifiedEmbeddingGemma 2 首次把文本、代码、图像、视频和音频统一映射到同一个嵌入空间,并针对端侧优化支持本地部署 RAG
50%Unverified建立索引时不要选择整个 C 盘或系统盘,否则会耗费大量时间和磁盘缓存空间,应针对具体素材文件夹建立索引
50%UnverifiedEmbeddingGemma 2 在本地运行不上传数据到云端,可保护隐私
50%Unverified启动工具后终端窗口不能关闭,否则网页端无法使用
50%Unverified在实测中搜索“猫”时,未标注关键词的猫视频和图片仍能被模型准确识别并召回,狗类内容因相似度低排到靠后
50%