待验证50% 置信事实时间未知
SD1.5中CLIP文本编码器将提示词转换为768维向量,SDXL转换为1024维向量
1
来源数
50%
置信度
中期 (~90 天)
时效性
2026/7/2
首次发现
有效期至:2026/9/30
来源
相关事实
待验证文本条件注入通过CLIP的交叉注意力层实现,ViT-L/14版本的CLIP将文本token映射为768维向量序列73% 相似待验证CLIP的文本编码器基于Transformer架构,将输入文本映射为512维或768维的嵌入向量72% 相似待验证在Stable Diffusion中,CLIP文本编码器将自然语言切分为最多77个token,每个token映射为768维或1024维嵌入向量67% 相似已验证text-embedding-ada-002将文本转化为1536维的稠密向量,语义相近的文本在向量空间中距离更近65% 相似已验证Stable Diffusion的文本引导通过CLIP文本编码器将提示词转化为向量64% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/59732API
curl https://kongchang.com/api/v1/knowledge/claims/59732MCP
get_claim(id=59732)