[KongchangAI]
ModelEmbedding Gemma 2

EmbeddingGemma2

Google开源的多模态Embedding模型,基于Gemma 2语言模型架构,支持文字、图片、音频和视频等多种模态的内容统一编码为768维向量,可将不同模态内容映射到同一向量空间,支持跨模态语义检索

Core Facts

Timeline (last 90 days)

Oct 7

Google开源了多模态Embedding模型EmbeddingGemma2,能将文字和图片转换到同一个向量空间

Unverified60%
Oct 7

EmbeddingGemma2除了文字和图片外还支持音频和视频,把不同模态内容都转换成768维向量

Partially Verified65%
Oct 7

EmbeddingGemma2的文字和图片各有独立的Encoder,但输出到同一个768维共享向量空间,因此一句话可以直接和一张图片做比较

Unverified50%
Oct 7

EmbeddingGemma2基于Gemma 2语言模型架构,经过多模态对比学习训练

Unverified50%
Oct 7

跨模态检索不应使用固定数字门槛过滤结果,而应依据排名

Unverified50%
Oct 7

EmbeddingGemma2采用Matryoshka表示学习,将最重要的信息编码到向量最前面,支持向量截断

Unverified50%
Oct 7

Google表示用256维搜索仍能保留约95%的质量

Unverified50%
Oct 7

向量截断后长度不再为1(前256维长度约0.709),必须重新归一化

Unverified50%
Oct 7

768维向量截断到256维可使数据量缩小约三倍(100万张照片从约3GB降到约1GB),且前9张搜索结果与768维完全一致

Unverified50%

All Facts (9)

Source Articles