EmbeddingGemma2
Google开源的多模态Embedding模型,基于Gemma 2语言模型架构,支持文字、图片、音频和视频等多种模态的内容统一编码为768维向量,可将不同模态内容映射到同一向量空间,支持跨模态语义检索
核心事实
时间轴 (近 90 天)
Google开源了多模态Embedding模型EmbeddingGemma2,能将文字和图片转换到同一个向量空间
EmbeddingGemma2除了文字和图片外还支持音频和视频,把不同模态内容都转换成768维向量
EmbeddingGemma2的文字和图片各有独立的Encoder,但输出到同一个768维共享向量空间,因此一句话可以直接和一张图片做比较
EmbeddingGemma2基于Gemma 2语言模型架构,经过多模态对比学习训练
跨模态检索不应使用固定数字门槛过滤结果,而应依据排名
EmbeddingGemma2采用Matryoshka表示学习,将最重要的信息编码到向量最前面,支持向量截断
Google表示用256维搜索仍能保留约95%的质量
向量截断后长度不再为1(前256维长度约0.709),必须重新归一化
768维向量截断到256维可使数据量缩小约三倍(100万张照片从约3GB降到约1GB),且前9张搜索结果与768维完全一致
全部知识事实 (9)
EmbeddingGemma2除了文字和图片外还支持音频和视频,把不同模态内容都转换成768维向量
65%待验证Google开源了多模态Embedding模型EmbeddingGemma2,能将文字和图片转换到同一个向量空间
60%待验证EmbeddingGemma2基于Gemma 2语言模型架构,经过多模态对比学习训练
50%待验证跨模态检索不应使用固定数字门槛过滤结果,而应依据排名
50%待验证EmbeddingGemma2采用Matryoshka表示学习,将最重要的信息编码到向量最前面,支持向量截断
50%待验证Google表示用256维搜索仍能保留约95%的质量
50%待验证向量截断后长度不再为1(前256维长度约0.709),必须重新归一化
50%待验证768维向量截断到256维可使数据量缩小约三倍(100万张照片从约3GB降到约1GB),且前9张搜索结果与768维完全一致
50%待验证EmbeddingGemma2的文字和图片各有独立的Encoder,但输出到同一个768维共享向量空间,因此一句话可以直接和一张图片做比较
50%