待验证50% 置信事实精确时间
CLIP ViT-L参数量约3亿,嵌入维度为768
1
来源数
50%
置信度
长期有效
时效性
2026/7/10
首次发现
来源
DINOv2 vs SigLIP:k-NN分类为何差距悬殊?视觉编码器选型避坑指南
redditr/MachineLearning2026/7/8
相关事实
待验证ViT-L模型约3亿参数,checkpoint达1213MB,CPU上处理每张图像需4.5秒72% 相似待验证ViT-S版本嵌入维度为384,为每个16×16图像块输出一个384维特征向量71% 相似待验证DINOv2 Giant参数量约11亿、嵌入维度1536,均显著大于SigLIP2 SO400M(约4亿参数、维度1152)和CLIP ViT-L(约3亿参数、维度768),但k-NN任务表现最差68% 相似已验证参数量达1750亿的GPT-4级模型,即便以fp8精度存储也需要约175GB显存63% 相似待验证量化后70亿参数模型的显存需求从约28GB压缩至约4-6GB,普通消费级显卡如RTX 3060/4060即可流畅运行Llama 3、Qwen2.5、Mistral等70亿参数级别模型60% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/469427API
curl https://kongchang.com/api/v1/knowledge/claims/469427MCP
get_claim(id=469427)