Unverified50% confidenceFactExact time
文本token大致对应0.75个英文单词或约1.5个中文字符,图像视觉编码器通常将一张图切分为数百个视觉token
1
Sources
50%
Confidence
Long-term
Relevance
9/11/2026
First Seen
Sources
Related Entities
Related Claims
Unverified在Stable Diffusion中,CLIP文本编码器将自然语言切分为最多77个token,每个token映射为768维或1024维嵌入向量68% similarUnverified上下文窗口决定模型单次能处理的文本量:8K约6000词,32K约24000词,128K可处理整本书内容64% similarVerifiedtext-embedding-ada-002将文本转化为1536维的稠密向量,语义相近的文本在向量空间中距离更近63% similarUnverified图生词(Image-to-Text)利用多模态大语言模型的视觉理解能力,将视觉特征映射到自然语言描述62% similarUnverified令牌是大语言模型处理文本的基本计量单位,英文中一个令牌约对应0.75个单词62% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/902376API
curl https://kongchang.com/api/v1/knowledge/claims/902376MCP
get_claim(id=902376)