Unverified50% confidenceSolutionExact time
视频VAE通常采用3D卷积或因果卷积结构,将连续数帧压缩为一个时间token,以降低时序建模的计算负担
1
Sources
50%
Confidence
Long-term
Relevance
8/21/2026
First Seen
Sources
Related Claims
Unverified视频VQ-VAE、3D卷积、均匀采样关键帧后用ViT编码是主流的视频token化方法77% similarUnverified图生视频中条件图像通常通过VAE编码为潜空间表示,然后与噪声序列拼接或通过交叉注意力注入生成过程72% similarUnverifiedVideoViT 是将 Vision Transformer 架构扩展至视频域的技术路线,通过在时间维度引入注意力机制建模帧间关系,并使用 Tubelet Embedding 将连续帧时空体素化为三维 patch72% similarVerified视频扩散模型采用扩散变换器(DiT)架构,通过在时序注意力层引入3D时空注意力机制同时建模空间与时间维度72% similarUnverified文生视频难度远超文生图,因为视频需要同时保证空间一致性与时间一致性71% similar
Cite This Claim
Stable URI
https://kongchang.com/claim/782808API
curl https://kongchang.com/api/v1/knowledge/claims/782808MCP
get_claim(id=782808)