Video ModeM是一个用于评估多模态大语言模型视频理解能力的基准测试,旨在衡量模型对视频内容的感知、推理与问答能力。该基准通常涵盖多种视频类型与任务场景,考察模型在时序理解、视觉语义对齐等方面的综合表现,是评估视频多模态模型能力的重要参考工具之一。