Unverified50% confidenceFactExact time
SD 1.x 使用 CLIP ViT-L 作为文本编码器,其词汇量和语义理解能力有限,对复杂句式和多概念组合容易出现语义漂移
1
Sources
50%
Confidence
Long-term
Relevance
9/28/2026
First Seen
Sources
Related Entities
Related Claims
UnverifiedCLIP或T5等文本编码器在处理数字概念时往往将其编码为模糊的量感而非精确的计数指令69% similarVerifiedCLIP、T5等文本编码器负责将自然语言转化为模型可理解的向量表示,是决定提示词遵从度的关键模块68% similarUnverified文本条件注入通过CLIP的交叉注意力层实现,ViT-L/14版本的CLIP将文本token映射为768维向量序列66% similarUnverifiedCLIP ViT-L文本编码器仅支持77个Token,参数量通常在数亿级别,而Qwen等大语言模型作为文本编码器参数量达数十亿级别65% similarUnverifiedSD1.5中CLIP文本编码器将提示词转换为768维向量,SDXL转换为1024维向量64% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/954911API
curl https://kongchang.com/api/v1/knowledge/claims/954911MCP
get_claim(id=954911)