Unverified50% confidenceFactExact time
主流VLM通常采用预训练的Vision Transformer(ViT)作为视觉编码器,如CLIP ViT、SigLIP等
1
Sources
50%
Confidence
Long-term
Relevance
9/10/2026
First Seen
Sources
Related Entities
Cite This Claim
Stable URI
https://kongchang.com/claim/891041API
curl https://kongchang.com/api/v1/knowledge/claims/891041MCP
get_claim(id=891041)