Unverified50% confidenceFactExact time
文生视频模型架构中,早期多采用U-Net结构(如Stable Video Diffusion),新一代模型倾向于使用Transformer架构(如DiT)
1
Sources
50%
Confidence
Long-term
Relevance
8/8/2026
First Seen
Sources
Related Claims
Unverified早期视频生成模型基于U-Net架构,而扩散变换器将Transformer的注意力机制引入扩散过程79% similarUnverified现代视频扩散模型通常采用U-Net或DiT(Diffusion Transformer)架构来预测每一步添加的噪声79% similarVerified万象(Wan)视频生成模型基于 DiT(Diffusion Transformer)架构79% similarVerifiedDiT架构相比早期基于U-Net的扩散模型,在处理长序列视频帧时具有更强的时序一致性79% similarUnverifiedSora、Stable Video Diffusion等前沿视频生成模型均采用DiT或其变体75% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/707178API
curl https://kongchang.com/api/v1/knowledge/claims/707178MCP
get_claim(id=707178)