CapMem
用于评测视觉-语言模型在长视频情景记忆理解能力的基准数据集,包含75段视频、1000道多项选择题,覆盖16种场景,总时长33.7小时,核心任务为情景记忆视频字幕问答
Timeline (last 90 days)
CapMem 提出将长视频内容转写成文本字幕(caption),作为一种可复用的情景记忆载体,用于长视频情景推理
CapMem 定义了新任务:情景记忆视频字幕问答(Episodic Memory Video Caption QA)
CapMem 基准数据集包含75段视频,总时长33.7小时,1000道人工标注的多项选择题,覆盖16种不同场景
在30秒字幕窗口下,12个模型中有10个表现更优;在60秒字幕窗口下,12个模型中有8个表现更优
在六个Qwen系列模型上进行匹配帧数(matched-frame)的对照实验,字幕方案在帧数对齐条件下平均准确率提升3.22分和2.55分
研究团队设计的字幕引导的检索-验证(retrieve-and-verify)框架将准确率再提升多达5.3分
字幕方案存在局限:字幕生成质量以及无法用语言精确描述的视觉细节可能成为信息瓶颈
All Facts (7)
CapMem 提出将长视频内容转写成文本字幕(caption),作为一种可复用的情景记忆载体,用于长视频情景推理
50%UnverifiedCapMem 定义了新任务:情景记忆视频字幕问答(Episodic Memory Video Caption QA)
50%UnverifiedCapMem 基准数据集包含75段视频,总时长33.7小时,1000道人工标注的多项选择题,覆盖16种不同场景
50%Unverified在30秒字幕窗口下,12个模型中有10个表现更优;在60秒字幕窗口下,12个模型中有8个表现更优
50%Unverified在六个Qwen系列模型上进行匹配帧数(matched-frame)的对照实验,字幕方案在帧数对齐条件下平均准确率提升3.22分和2.55分
50%Unverified研究团队设计的字幕引导的检索-验证(retrieve-and-verify)框架将准确率再提升多达5.3分
50%Unverified字幕方案存在局限:字幕生成质量以及无法用语言精确描述的视觉细节可能成为信息瓶颈
50%