模型DINOv2 Giant
DINOv2
Meta AI于2023年提出的纯视觉自监督基础模型,训练框架融合iBOT等多种自监督技术,无文本监督信号,擅长语义分割等任务
核心事实
时间轴 (近 90 天)
10月4日
RADIO 是 NVIDIA 提出的视觉基础模型,通过蒸馏 CLIP、DINOv2、SAM 等多个视觉-语言预训练模型的知识,生成兼顾语义对齐与细粒度特征的视觉表征
待验证50%
9月27日
.char 构建过程使用 YuNet 定位人脸、SFace 提取人脸签名、DINOv2 提取主体整体特征签名
待验证50%
9月12日
多编码器融合方案(如同时使用CLIP和DINOv2)正成为提升VLM空间理解能力的常见手段
待验证50%
9月11日
研究团队用视频预训练的V-JEPA 1和V-JEPA 2编码器(ViT-L/ViT-G规模)替换DINOv2后,动作排序缺陷依然存在
待验证50%
9月9日
iBOT是DINOv2中使用的关键组件,结合了掩码图像建模与自蒸馏
待验证50%
8月18日
DINOv2是Meta AI于2023年发布的视觉基础模型,采用自监督学习范式在大规模无标注图像数据上进行预训练
已验证65%
全部知识事实 (6)
已验证
DINOv2是Meta AI于2023年发布的视觉基础模型,采用自监督学习范式在大规模无标注图像数据上进行预训练
65%待验证RADIO 是 NVIDIA 提出的视觉基础模型,通过蒸馏 CLIP、DINOv2、SAM 等多个视觉-语言预训练模型的知识,生成兼顾语义对齐与细粒度特征的视觉表征
50%待验证.char 构建过程使用 YuNet 定位人脸、SFace 提取人脸签名、DINOv2 提取主体整体特征签名
50%待验证多编码器融合方案(如同时使用CLIP和DINOv2)正成为提升VLM空间理解能力的常见手段
50%待验证研究团队用视频预训练的V-JEPA 1和V-JEPA 2编码器(ViT-L/ViT-G规模)替换DINOv2后,动作排序缺陷依然存在
50%待验证iBOT是DINOv2中使用的关键组件,结合了掩码图像建模与自蒸馏
50%