DiT
由Meta AI于2023年提出的扩散模型架构,以Vision Transformer替代传统U-Net作为扩散模型的主干网络,具有优秀的大规模参数扩展性,被Sora等前沿视频生成模型采用
核心事实
时间轴 (近 90 天)
Stable Diffusion 3.5 引入了 Transformer 主干(DiT 结构),参数规模与生成质量相比前代均有提升
Nanosaur 2 的核心是一个 670M 参数的 DiT(Diffusion Transformer)结构,配套一个全新的 VAE 以及一个 270M 参数的文本编码器
SupraLabs 团队发布了轻量级文生图模型 Supra2-IMG,参数量为1亿(100M),采用DiT架构从零训练,输出分辨率为256×256,并完全开源
图像生成模型的权重通常分为文本编码器、扩散主干网络(UNet 或 DiT)以及解码器(VAE)等多个组件
在扩散模型的U-Net或DiT架构中,注意力层的计算往往是显存和时间的主要消耗来源
研究引入Tiny DiT主干网络(10个epoch,秩取4/8/16)将结论从U-Net推广到Transformer架构的扩散模型
DiT是Stable Diffusion 3、FLUX等新一代生成模型的基础架构
一位开发者用一块 RTX PRO 6000、耗时 3.5 天,从零训练了一个 2.1 亿参数的文本到图像扩散 Transformer(DiT),训练数据为 420 万张 256² 分辨率图像
该模型架构为交叉注意力 DiT(896 宽 × 16 层),使用 2D RoPE、QK-norm、SwiGLU、adaLN-single
扩散模型(UNet/DiT主干网络)参数量大往往能承受较激进的量化,而文本编码器作为语义入口保留更高精度(如INT8甚至FP16)通常更划算
还有 20 条时间轴事件
全部知识事实 (20)
DiT由Peebles与Xie于2022年提出,将Transformer架构引入扩散过程
90%已验证H3 Minimax是Minimax公司的视频生成引擎,采用了稀疏注意力(Sparse Attention)机制
80%已验证Sora采用DiT(Diffusion Transformer)架构,将视频压缩为时空patch序列后输入Transformer,以Transformer替代传统U-Net作为去噪骨干网络
80%已验证万象(Wan)视频生成模型基于 DiT(Diffusion Transformer)架构
80%已验证FLUX采用了DiT(Diffusion Transformer)架构,用纯Transformer替代了传统的U-Net结构
80%已验证扩散 Transformer(DiT)是当前图像生成领域的主流架构,被用于 Stable Diffusion 3、FLUX 等模型
75%已验证Sora采用了Diffusion Transformer(DiT)架构,将Transformer全局注意力机制引入扩散框架
65%待验证Transformer架构被引入视觉生成(如Vision Transformer、DiT架构),使模型能更好理解图像不同区域间的全局关系,适用于多模态场景中文本token和图像token的统一处理
88%待验证DiT是Stable Diffusion 3、FLUX等新一代生成模型的基础架构
70%待验证DiT架构成为Sora、Kling、Wan等主流视频生成模型的共同技术选择
60%待验证OpenAI的Sora、Google的VideoPoet均采用将视频帧压缩为离散token后进行自回归预测的技术路线
60%待验证OpenAI 的 Sora 和快手的可灵(Kling)等视频生成模型也采用了类似 DiT 的技术路线
60%待验证Stable Diffusion 3.5 引入了 Transformer 主干(DiT 结构),参数规模与生成质量相比前代均有提升
50%待验证Nanosaur 2 的核心是一个 670M 参数的 DiT(Diffusion Transformer)结构,配套一个全新的 VAE 以及一个 270M 参数的文本编码器
50%待验证图像生成模型的权重通常分为文本编码器、扩散主干网络(UNet 或 DiT)以及解码器(VAE)等多个组件
50%待验证在扩散模型的U-Net或DiT架构中,注意力层的计算往往是显存和时间的主要消耗来源
50%待验证研究引入Tiny DiT主干网络(10个epoch,秩取4/8/16)将结论从U-Net推广到Transformer架构的扩散模型
50%待验证该模型架构为交叉注意力 DiT(896 宽 × 16 层),使用 2D RoPE、QK-norm、SwiGLU、adaLN-single
50%待验证扩散模型(UNet/DiT主干网络)参数量大往往能承受较激进的量化,而文本编码器作为语义入口保留更高精度(如INT8甚至FP16)通常更划算
50%待验证Sora是OpenAI在2024年发布的文本到视频生成模型,基于DiT(Diffusion Transformer)架构
50%