[控场AI]
模型Diffusion Transformer

DiT

由Meta AI于2023年提出的扩散模型架构,以Vision Transformer替代传统U-Net作为扩散模型的主干网络,具有优秀的大规模参数扩展性,被Sora等前沿视频生成模型采用

核心事实

时间轴 (近 90 天)

10月5日

Stable Diffusion 3.5 引入了 Transformer 主干(DiT 结构),参数规模与生成质量相比前代均有提升

待验证50%
9月26日

Nanosaur 2 的核心是一个 670M 参数的 DiT(Diffusion Transformer)结构,配套一个全新的 VAE 以及一个 270M 参数的文本编码器

待验证50%
9月21日

SupraLabs 团队发布了轻量级文生图模型 Supra2-IMG,参数量为1亿(100M),采用DiT架构从零训练,输出分辨率为256×256,并完全开源

待验证50%
9月20日

图像生成模型的权重通常分为文本编码器、扩散主干网络(UNet 或 DiT)以及解码器(VAE)等多个组件

待验证50%
9月16日

在扩散模型的U-Net或DiT架构中,注意力层的计算往往是显存和时间的主要消耗来源

待验证50%
9月12日

研究引入Tiny DiT主干网络(10个epoch,秩取4/8/16)将结论从U-Net推广到Transformer架构的扩散模型

待验证50%
9月12日

DiT是Stable Diffusion 3、FLUX等新一代生成模型的基础架构

待验证70%
9月11日

一位开发者用一块 RTX PRO 6000、耗时 3.5 天,从零训练了一个 2.1 亿参数的文本到图像扩散 Transformer(DiT),训练数据为 420 万张 256² 分辨率图像

待验证50%
9月11日

该模型架构为交叉注意力 DiT(896 宽 × 16 层),使用 2D RoPE、QK-norm、SwiGLU、adaLN-single

待验证50%
9月11日

扩散模型(UNet/DiT主干网络)参数量大往往能承受较激进的量化,而文本编码器作为语义入口保留更高精度(如INT8甚至FP16)通常更划算

待验证50%

还有 20 条时间轴事件

全部知识事实 (20)

已验证

DiT由Peebles与Xie于2022年提出,将Transformer架构引入扩散过程

90%
已验证

H3 Minimax是Minimax公司的视频生成引擎,采用了稀疏注意力(Sparse Attention)机制

80%
已验证

Sora采用DiT(Diffusion Transformer)架构,将视频压缩为时空patch序列后输入Transformer,以Transformer替代传统U-Net作为去噪骨干网络

80%
已验证

万象(Wan)视频生成模型基于 DiT(Diffusion Transformer)架构

80%
已验证

FLUX采用了DiT(Diffusion Transformer)架构,用纯Transformer替代了传统的U-Net结构

80%
已验证

扩散 Transformer(DiT)是当前图像生成领域的主流架构,被用于 Stable Diffusion 3、FLUX 等模型

75%
已验证

Sora采用了Diffusion Transformer(DiT)架构,将Transformer全局注意力机制引入扩散框架

65%
待验证

Transformer架构被引入视觉生成(如Vision Transformer、DiT架构),使模型能更好理解图像不同区域间的全局关系,适用于多模态场景中文本token和图像token的统一处理

88%
待验证

DiT是Stable Diffusion 3、FLUX等新一代生成模型的基础架构

70%
待验证

DiT架构成为Sora、Kling、Wan等主流视频生成模型的共同技术选择

60%
待验证

OpenAI的Sora、Google的VideoPoet均采用将视频帧压缩为离散token后进行自回归预测的技术路线

60%
待验证

OpenAI 的 Sora 和快手的可灵(Kling)等视频生成模型也采用了类似 DiT 的技术路线

60%
待验证

Stable Diffusion 3.5 引入了 Transformer 主干(DiT 结构),参数规模与生成质量相比前代均有提升

50%
待验证

Nanosaur 2 的核心是一个 670M 参数的 DiT(Diffusion Transformer)结构,配套一个全新的 VAE 以及一个 270M 参数的文本编码器

50%
待验证

图像生成模型的权重通常分为文本编码器、扩散主干网络(UNet 或 DiT)以及解码器(VAE)等多个组件

50%
待验证

在扩散模型的U-Net或DiT架构中,注意力层的计算往往是显存和时间的主要消耗来源

50%
待验证

研究引入Tiny DiT主干网络(10个epoch,秩取4/8/16)将结论从U-Net推广到Transformer架构的扩散模型

50%
待验证

该模型架构为交叉注意力 DiT(896 宽 × 16 层),使用 2D RoPE、QK-norm、SwiGLU、adaLN-single

50%
待验证

扩散模型(UNet/DiT主干网络)参数量大往往能承受较激进的量化,而文本编码器作为语义入口保留更高精度(如INT8甚至FP16)通常更划算

50%
待验证

Sora是OpenAI在2024年发布的文本到视频生成模型,基于DiT(Diffusion Transformer)架构

50%

来源文章