ModelViT
Vision Transformer
将Transformer架构应用于图像处理的视觉模型,将图像分割为patches后作为序列输入Transformer,是DiT的核心骨干网络
Timeline (last 90 days)
Aug 22
ViTPose+是基于Vision Transformer架构的人体姿态估计模型,由悉尼大学等机构的研究团队开发,Huge是其中参数规模最大、精度最强的版本
Unverified50%
Aug 4
Transformer架构被引入视觉生成(如Vision Transformer、DiT架构),使模型能更好理解图像不同区域间的全局关系,适用于多模态场景中文本token和图像token的统一处理
Unverified88%