[KongchangAI]
ModelEmbeddingGemma2

EmbeddingGemma 2

Google DeepMind推出的多模态嵌入模型,支持文本、代码、图像、视频和音频的向量化,适用于语义搜索、RAG、分类和聚类任务,支持100+语言

Core Facts

Timeline (last 90 days)

Oct 8

EmbeddingGemma 2 是一个多模态检索开源模型,支持用自己的数据进行微调

Unverified50%
Oct 8

作者用Gemini 3 Flash为120个视频字幕段落生成观众风格问题构成「问题—段落」数据对,训练不到三分钟后首位命中率从约三分之二提升到约四分之三

Unverified50%
Oct 8

语音搜索一度掉到接近零是因为与适配器一起保存的processor把音频裁成几毫秒,修复方法是复用基础模型的processor

Unverified50%
Oct 8

微调音频主干后,图片搜索和语音搜索未变化,但通用文本搜索下降约4分,这是改动共享主干的代价

Unverified50%
Oct 8

将10种声音完全从训练中剔除后测试,这些未见过的声音没有改善,表明模型学的是给定标签而非通用听觉能力,不会自动泛化到未训练标签

Unverified50%
Oct 8

在ESC-50数据集的声音分类实验中,训练前首位命中率约25%,在A100上训练约七分半钟后提升到约66%

Unverified50%
Oct 8

EmbeddingGemma 2 的文本、图像、视频、音频共用同一个主干网络,在某一模态上训练主干会改变其他模态的表现

Unverified50%
Oct 8

EmbeddingGemma 2 要求搜索查询前加简短任务提示,文档用「标题+正文」格式,训练与推理的模板必须完全一致

Unverified50%
Oct 8

EmbeddingGemma 2 首次把文本、代码、图像、视频和音频统一映射到同一个嵌入空间,并针对端侧优化支持本地部署 RAG

Unverified50%
Oct 8

Google DeepMind发布了Embedding Gemma 2,一个开放的多模态嵌入模型,参数量740M,将文字、图片、视频和音频映射到同一向量空间

Unverified60%

40 more timeline events

All Facts (20)

Partially Verified

量化后,EmbeddingGemma 2 在 Google Pixel 11 Pro 上纯文本权重仅需约 191MB 活跃内存,完整多模态模型约需 567MB

80%
Partially Verified

EmbeddingGemma 2 是谷歌基于 Gemma 4 架构打造的多模态嵌入模型,能够将文本、图像、音频和视频编码到共享的 768 维向量空间中

75%
Partially Verified

EmbeddingGemma 2 采用 Matryoshka Representation Learning 技术,嵌入向量可被截断到 512、256 或 128 维而不会严重损失表达质量

75%
Partially Verified

Google发布Embedding Gemma 2,是其首个面向端侧的原生多模态开放嵌入模型,仅7.4亿参数,采用Apache 2.0许可证开放权重,可在同一共享空间理解文本、代码、图像、音频和视频

75%
Partially Verified

EmbeddingGemma2除了文字和图片外还支持音频和视频,把不同模态内容都转换成768维向量

65%
Unverified

Google DeepMind发布了Embedding Gemma 2,一个开放的多模态嵌入模型,参数量740M,将文字、图片、视频和音频映射到同一向量空间

60%
Unverified

Google开源了多模态Embedding模型EmbeddingGemma2,能将文字和图片转换到同一个向量空间

60%
Unverified

在ESC-50数据集的声音分类实验中,训练前首位命中率约25%,在A100上训练约七分半钟后提升到约66%

50%
Unverified

EmbeddingGemma 2 的文本、图像、视频、音频共用同一个主干网络,在某一模态上训练主干会改变其他模态的表现

50%
Unverified

EmbeddingGemma 2 要求搜索查询前加简短任务提示,文档用「标题+正文」格式,训练与推理的模板必须完全一致

50%
Unverified

语音搜索一度掉到接近零是因为与适配器一起保存的processor把音频裁成几毫秒,修复方法是复用基础模型的processor

50%
Unverified

作者用Gemini 3 Flash为120个视频字幕段落生成观众风格问题构成「问题—段落」数据对,训练不到三分钟后首位命中率从约三分之二提升到约四分之三

50%
Unverified

将10种声音完全从训练中剔除后测试,这些未见过的声音没有改善,表明模型学的是给定标签而非通用听觉能力,不会自动泛化到未训练标签

50%
Unverified

EmbeddingGemma 2 是一个多模态检索开源模型,支持用自己的数据进行微调

50%
Unverified

微调音频主干后,图片搜索和语音搜索未变化,但通用文本搜索下降约4分,这是改动共享主干的代价

50%
Unverified

EmbeddingGemma 2 首次把文本、代码、图像、视频和音频统一映射到同一个嵌入空间,并针对端侧优化支持本地部署 RAG

50%
Unverified

建立索引时不要选择整个 C 盘或系统盘,否则会耗费大量时间和磁盘缓存空间,应针对具体素材文件夹建立索引

50%
Unverified

EmbeddingGemma 2 在本地运行不上传数据到云端,可保护隐私

50%
Unverified

启动工具后终端窗口不能关闭,否则网页端无法使用

50%
Unverified

在实测中搜索“猫”时,未标注关键词的猫视频和图片仍能被模型准确识别并召回,狗类内容因相似度低排到靠后

50%

Source Articles