[KongchangAI]
Unverified50% confidenceFactExact time

VideoViT 是将 Vision Transformer 架构扩展至视频域的技术路线,通过在时间维度引入注意力机制建模帧间关系,并使用 Tubelet Embedding 将连续帧时空体素化为三维 patch

1
Sources
50%
Confidence
Long-term
Relevance
7/25/2026
First Seen

Sources

Related Claims

Cite This Claim

Stable URI
https://kongchang.com/claim/613462
API
curl https://kongchang.com/api/v1/knowledge/claims/613462
MCP
get_claim(id=613462)