[控场AI]
模型DINOv2 Giant

DINOv2

Meta AI于2023年提出的纯视觉自监督基础模型,训练框架融合iBOT等多种自监督技术,无文本监督信号,擅长语义分割等任务

核心事实

时间轴 (近 90 天)

10月4日

RADIO 是 NVIDIA 提出的视觉基础模型,通过蒸馏 CLIP、DINOv2、SAM 等多个视觉-语言预训练模型的知识,生成兼顾语义对齐与细粒度特征的视觉表征

待验证50%
9月27日

.char 构建过程使用 YuNet 定位人脸、SFace 提取人脸签名、DINOv2 提取主体整体特征签名

待验证50%
9月12日

多编码器融合方案(如同时使用CLIP和DINOv2)正成为提升VLM空间理解能力的常见手段

待验证50%
9月11日

研究团队用视频预训练的V-JEPA 1和V-JEPA 2编码器(ViT-L/ViT-G规模)替换DINOv2后,动作排序缺陷依然存在

待验证50%
9月9日

iBOT是DINOv2中使用的关键组件,结合了掩码图像建模与自蒸馏

待验证50%
8月18日

DINOv2是Meta AI于2023年发布的视觉基础模型,采用自监督学习范式在大规模无标注图像数据上进行预训练

已验证65%

全部知识事实 (6)

来源文章