待验证50% 置信事实精确时间
早期Stable Diffusion系列以CLIP为文本编码器,对超过77个Token的提示词处理能力受限
1
来源数
50%
置信度
长期有效
时效性
2026/7/12
首次发现
来源
AI图像生成工具深度横评:Flux、Midjourney、Gemini怎么选?
redditr/learnmachinelearning2026/7/11
相关事实
待验证在Stable Diffusion中,CLIP文本编码器将自然语言切分为最多77个token,每个token映射为768维或1024维嵌入向量79% 相似已验证Stable Diffusion的文本引导通过CLIP文本编码器将提示词转化为向量79% 相似待验证CLIP文本编码器的标准上下文窗口长度约为77个Token,超出部分的语义信息会被截断或降权处理72% 相似待验证文本条件注入通过CLIP的交叉注意力层实现,ViT-L/14版本的CLIP将文本token映射为768维向量序列69% 相似待验证主流文生图模型如Stable Diffusion、Midjourney、DALL-E的底层架构通常是扩散模型与CLIP文本编码器的结合65% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/494158API
curl https://kongchang.com/api/v1/knowledge/claims/494158MCP
get_claim(id=494158)