由Meta AI于2023年提出的扩散模型架构,以Vision Transformer替代传统U-Net作为扩散模型的主干网络,具有优秀的大规模参数扩展性,被Sora等前沿视频生成模型采用
扩散模型的反向过程通常使用U-Net或DiT(Diffusion Transformer)架构来预测每一步应去除的噪声量
Transformer架构被引入视觉生成(如Vision Transformer、DiT架构),使模型能更好理解图像不同区域间的全局关系,适用于多模态场景中文本token和图像token的统一处理
DiT架构成为Sora、Kling、Wan等主流视频生成模型的共同技术选择