待验证90% 置信事实时间未知
SD3引入了MMDiT(Multi-Modal Diffusion Transformer)架构,用Transformer替代了传统的U-Net骨干网络,并采用三重文本编码器(CLIP ViT-L、OpenCLIP ViT-bigG、T5-XXL)
1
来源数
90%
置信度
长期有效
时效性
2026/6/1
首次发现
来源
SwarmUI完全指南:高性能Stable Diffusion界面工具
githubmcmonkeyprojects
涉及实体
相关事实
已验证FLUX采用了DiT(Diffusion Transformer)架构,用纯Transformer替代了传统的U-Net结构65% 相似已验证Transformer已从NLP渗透至计算机视觉(ViT)、语音识别(Whisper)、多模态模型(CLIP、GPT-4V)乃至蛋白质结构预测(AlphaFold2)64% 相似已验证LTX 2.3采用基于Transformer的扩散架构(DiT,Diffusion Transformer),相较于传统U-Net架构具有更强的时序一致性建模能力64% 相似待验证相比RNN/LSTM架构,Transformer支持大规模并行计算63% 相似待验证Transformers框架原生支持bitsandbytes、GPTQ、AWQ等主流量化方案62% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/29006API
curl https://kongchang.com/api/v1/knowledge/claims/29006MCP
get_claim(id=29006)