Unverified50% confidenceFactTime unknown
SD1.5中CLIP文本编码器将提示词转换为768维向量,SDXL转换为1024维向量
1
Sources
50%
Confidence
Medium-term (~90 days)
Relevance
7/2/2026
First Seen
Valid until: 9/30/2026
Sources
Related Claims
Unverified文本条件注入通过CLIP的交叉注意力层实现,ViT-L/14版本的CLIP将文本token映射为768维向量序列73% similarUnverifiedCLIP的文本编码器基于Transformer架构,将输入文本映射为512维或768维的嵌入向量72% similarUnverified在Stable Diffusion中,CLIP文本编码器将自然语言切分为最多77个token,每个token映射为768维或1024维嵌入向量67% similarVerifiedtext-embedding-ada-002将文本转化为1536维的稠密向量,语义相近的文本在向量空间中距离更近65% similarVerifiedStable Diffusion的文本引导通过CLIP文本编码器将提示词转化为向量64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/59732API
curl https://kongchang.com/api/v1/knowledge/claims/59732MCP
get_claim(id=59732)