将Transformer架构应用于图像处理的视觉模型,将图像分割为patches后作为序列输入Transformer,是DiT的核心骨干网络
ViTPose+是基于Vision Transformer架构的人体姿态估计模型,由悉尼大学等机构的研究团队开发,Huge是其中参数规模最大、精度最强的版本
Transformer架构被引入视觉生成(如Vision Transformer、DiT架构),使模型能更好理解图像不同区域间的全局关系,适用于多模态场景中文本token和图像token的统一处理