[KongchangAI]
ModelDiffusion Transformer

DiT

由Meta AI于2023年提出的扩散模型架构,以Vision Transformer替代传统U-Net作为扩散模型的主干网络,具有优秀的大规模参数扩展性,被Sora等前沿视频生成模型采用

Timeline (last 90 days)

Aug 24

扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量

Unverified50%
Aug 4

Transformer架构被引入视觉生成(如Vision Transformer、DiT架构),使模型能更好理解图像不同区域间的全局关系,适用于多模态场景中文本token和图像token的统一处理

Unverified88%
Jul 15

DiT架构成为Sora、Kling、Wan等主流视频生成模型的共同技术选择

Unverified50%

All Facts (3)

Source Articles