Unverified50% confidenceFactExact time
早期Stable Diffusion系列以CLIP为文本编码器,对超过77个Token的提示词处理能力受限
1
Sources
50%
Confidence
Long-term
Relevance
7/12/2026
First Seen
Sources
AI图像生成工具深度横评:Flux、Midjourney、Gemini怎么选?
redditr/learnmachinelearning7/11/2026
Related Claims
Unverified在Stable Diffusion中,CLIP文本编码器将自然语言切分为最多77个token,每个token映射为768维或1024维嵌入向量79% similarVerifiedStable Diffusion的文本引导通过CLIP文本编码器将提示词转化为向量79% similarUnverifiedCLIP文本编码器的标准上下文窗口长度约为77个Token,超出部分的语义信息会被截断或降权处理72% similarUnverified文本条件注入通过CLIP的交叉注意力层实现,ViT-L/14版本的CLIP将文本token映射为768维向量序列69% similarUnverified主流文生图模型如Stable Diffusion、Midjourney、DALL-E的底层架构通常是扩散模型与CLIP文本编码器的结合65% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/494158API
curl https://kongchang.com/api/v1/knowledge/claims/494158MCP
get_claim(id=494158)