[KongchangAI]
ModelDINOv2 Giant

DINOv2

Meta AI于2023年提出的纯视觉自监督基础模型,训练框架融合iBOT等多种自监督技术,无文本监督信号,擅长语义分割等任务

Core Facts

Timeline (last 90 days)

Oct 4

RADIO 是 NVIDIA 提出的视觉基础模型,通过蒸馏 CLIP、DINOv2、SAM 等多个视觉-语言预训练模型的知识,生成兼顾语义对齐与细粒度特征的视觉表征

Unverified50%
Sep 27

.char 构建过程使用 YuNet 定位人脸、SFace 提取人脸签名、DINOv2 提取主体整体特征签名

Unverified50%
Sep 12

多编码器融合方案(如同时使用CLIP和DINOv2)正成为提升VLM空间理解能力的常见手段

Unverified50%
Sep 11

研究团队用视频预训练的V-JEPA 1和V-JEPA 2编码器(ViT-L/ViT-G规模)替换DINOv2后,动作排序缺陷依然存在

Unverified50%
Sep 9

iBOT是DINOv2中使用的关键组件,结合了掩码图像建模与自蒸馏

Unverified50%
Aug 18

DINOv2是Meta AI于2023年发布的视觉基础模型,采用自监督学习范式在大规模无标注图像数据上进行预训练

Verified65%

All Facts (6)

Source Articles