Meta开发的视频理解模型,采用「联合嵌入预测架构」(Joint Embedding Predictive Architecture),试图捕捉视频中的结构化因果关系,是世界模型研究的重要探索
Meta研究团队提出的V-JEPA模型、Google DeepMind的Genie等项目在探索让AI建立对物理世界的内在模拟
Yann LeCun提出JEPA框架,核心思想是在抽象的表征空间而非像素空间中进行预测,Meta已发布V-JEPA等早期实现
V-JEPA由Meta AI于2024年发布,通过遮蔽视频中最高可达90%的时空区域训练模型在表征空间预测被遮蔽部分
I-JEPA(图像版本)和 V-JEPA(视频版本)均由 Meta AI 发布并开源