[KongchangAI]
ModelViT

Vision Transformer

将Transformer架构应用于图像处理的视觉模型,将图像分割为patches后作为序列输入Transformer,是DiT的核心骨干网络

Timeline (last 90 days)

Aug 22

ViTPose+是基于Vision Transformer架构的人体姿态估计模型,由悉尼大学等机构的研究团队开发,Huge是其中参数规模最大、精度最强的版本

Unverified50%
Aug 4

Transformer架构被引入视觉生成(如Vision Transformer、DiT架构),使模型能更好理解图像不同区域间的全局关系,适用于多模态场景中文本token和图像token的统一处理

Unverified88%

All Facts (2)

Source Articles