EmbeddingGemma2
Google开源的多模态Embedding模型,基于Gemma 2语言模型架构,支持文字、图片、音频和视频等多种模态的内容统一编码为768维向量,可将不同模态内容映射到同一向量空间,支持跨模态语义检索
Core Facts
Timeline (last 90 days)
Google开源了多模态Embedding模型EmbeddingGemma2,能将文字和图片转换到同一个向量空间
EmbeddingGemma2除了文字和图片外还支持音频和视频,把不同模态内容都转换成768维向量
EmbeddingGemma2的文字和图片各有独立的Encoder,但输出到同一个768维共享向量空间,因此一句话可以直接和一张图片做比较
EmbeddingGemma2基于Gemma 2语言模型架构,经过多模态对比学习训练
跨模态检索不应使用固定数字门槛过滤结果,而应依据排名
EmbeddingGemma2采用Matryoshka表示学习,将最重要的信息编码到向量最前面,支持向量截断
Google表示用256维搜索仍能保留约95%的质量
向量截断后长度不再为1(前256维长度约0.709),必须重新归一化
768维向量截断到256维可使数据量缩小约三倍(100万张照片从约3GB降到约1GB),且前9张搜索结果与768维完全一致
All Facts (9)
EmbeddingGemma2除了文字和图片外还支持音频和视频,把不同模态内容都转换成768维向量
65%UnverifiedGoogle开源了多模态Embedding模型EmbeddingGemma2,能将文字和图片转换到同一个向量空间
60%UnverifiedEmbeddingGemma2基于Gemma 2语言模型架构,经过多模态对比学习训练
50%Unverified跨模态检索不应使用固定数字门槛过滤结果,而应依据排名
50%UnverifiedEmbeddingGemma2采用Matryoshka表示学习,将最重要的信息编码到向量最前面,支持向量截断
50%UnverifiedGoogle表示用256维搜索仍能保留约95%的质量
50%Unverified向量截断后长度不再为1(前256维长度约0.709),必须重新归一化
50%Unverified768维向量截断到256维可使数据量缩小约三倍(100万张照片从约3GB降到约1GB),且前9张搜索结果与768维完全一致
50%UnverifiedEmbeddingGemma2的文字和图片各有独立的Encoder,但输出到同一个768维共享向量空间,因此一句话可以直接和一张图片做比较
50%