[KongchangAI]
BenchmarkCapMem基准 / 情景记忆视频字幕问答基准

CapMem

用于评测视觉-语言模型在长视频情景记忆理解能力的基准数据集,包含75段视频、1000道多项选择题,覆盖16种场景,总时长33.7小时,核心任务为情景记忆视频字幕问答

Timeline (last 90 days)

Sep 17

CapMem 提出将长视频内容转写成文本字幕(caption),作为一种可复用的情景记忆载体,用于长视频情景推理

Unverified50%
Sep 17

CapMem 定义了新任务:情景记忆视频字幕问答(Episodic Memory Video Caption QA)

Unverified50%
Sep 17

CapMem 基准数据集包含75段视频,总时长33.7小时,1000道人工标注的多项选择题,覆盖16种不同场景

Unverified50%
Sep 17

在30秒字幕窗口下,12个模型中有10个表现更优;在60秒字幕窗口下,12个模型中有8个表现更优

Unverified50%
Sep 17

在六个Qwen系列模型上进行匹配帧数(matched-frame)的对照实验,字幕方案在帧数对齐条件下平均准确率提升3.22分和2.55分

Unverified50%
Sep 17

研究团队设计的字幕引导的检索-验证(retrieve-and-verify)框架将准确率再提升多达5.3分

Unverified50%
Sep 17

字幕方案存在局限:字幕生成质量以及无法用语言精确描述的视觉细节可能成为信息瓶颈

Unverified50%

All Facts (7)

Source Articles