Unverified50% confidenceFactExact time
在Stable Diffusion中,CLIP文本编码器将自然语言切分为最多77个token,每个token映射为768维或1024维嵌入向量
1
Sources
50%
Confidence
Long-term
Relevance
8/19/2026
First Seen
Sources
Related Claims
VerifiedStable Diffusion的文本引导通过CLIP文本编码器将提示词转化为向量79% similarUnverified早期Stable Diffusion系列以CLIP为文本编码器,对超过77个Token的提示词处理能力受限79% similarUnverifiedCLIP文本编码器的标准上下文窗口长度约为77个Token,超出部分的语义信息会被截断或降权处理70% similarUnverified文本条件注入通过CLIP的交叉注意力层实现,ViT-L/14版本的CLIP将文本token映射为768维向量序列70% similarUnverifiedCLIP的文本编码器基于Transformer架构,将输入文本映射为512维或768维的嵌入向量69% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/773233API
curl https://kongchang.com/api/v1/knowledge/claims/773233MCP
get_claim(id=773233)