Unverified50% confidenceFactExact time
EmbeddingGemma2的文字和图片各有独立的Encoder,但输出到同一个768维共享向量空间,因此一句话可以直接和一张图片做比较
1
Sources
50%
Confidence
Long-term
Relevance
10/7/2026
First Seen
Sources
Related Entities
Related Claims
Unverified现代Embedding模型(如OpenAI的text-embedding-ada-002、阿里的千问Embedding系列)能够将整个句子或段落编码为固定维度的稠密向量,通常为768维或1024维68% similarUnverifiedVision Encoder 的核心作用是对齐(alignment),即把视觉空间的信息映射到大语言模型的语义空间67% similarVerified文本指令通过CLIP等跨模态编码器转化为语义向量,将文字和图像嵌入同一语义空间以引导图像生成67% similarVerifiedEmbedding是将文本转换为高维数值向量的过程,语义相近的文本在向量空间中距离更近66% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/985548API
curl https://kongchang.com/api/v1/knowledge/claims/985548MCP
get_claim(id=985548)