待验证50% 置信解决方案精确时间
视频VAE通常采用3D卷积或因果卷积结构,将连续数帧压缩为一个时间token,以降低时序建模的计算负担
1
来源数
50%
置信度
长期有效
时效性
2026/8/21
首次发现
来源
相关事实
待验证视频VQ-VAE、3D卷积、均匀采样关键帧后用ViT编码是主流的视频token化方法77% 相似待验证图生视频中条件图像通常通过VAE编码为潜空间表示,然后与噪声序列拼接或通过交叉注意力注入生成过程72% 相似待验证VideoViT 是将 Vision Transformer 架构扩展至视频域的技术路线,通过在时间维度引入注意力机制建模帧间关系,并使用 Tubelet Embedding 将连续帧时空体素化为三维 patch72% 相似已验证视频扩散模型采用扩散变换器(DiT)架构,通过在时序注意力层引入3D时空注意力机制同时建模空间与时间维度72% 相似待验证文生视频难度远超文生图,因为视频需要同时保证空间一致性与时间一致性71% 相似
引用此条事实
Stable URI
https://kongchang.com/claim/782808API
curl https://kongchang.com/api/v1/knowledge/claims/782808MCP
get_claim(id=782808)