24.05 Video-MME
5 min
这是一篇引用过千的经典 Video MLLM Benchmark,我们一起来看看
发现问题
目前的 MLLMs 和 Benchmark 都是针对静态视觉信息理解的,无法捕捉自然真实世界中随时间变化的复杂物体交互动态特性。为了更准确的近似真实世界场景,目前出现了一些建立在视觉信息序列(例如视频)之上的 MLLMs,并且产出了一些很有前景的结果。
但目前的基于视频的 Benchmark 仍然在彻底的评估模型性能方面受限,例如:
- 视频类型少
- 视频长度覆盖不全
- 聚焦在单个模态
解决问题
数据集构建
数据集构建有 3 个步骤:视频搜集、QA 标注、质量审查,这三个步骤解决了现有工作的不足
- 视频搜集:在 6 大领域 30 个小类中搜集了 900 个视频,覆盖了不同视频长度,并且顺带搜集了字幕(744 个)以及音频(900 个),这样就解决了现有 benchmark 工作的局限。
- QA 标注:设计了 12 种不同的任务,人工在每个视频上标注 3 个问题,使用多项选择题形式,共标注 2700 个问题。
- 质量审查:让不同的标注员再看一下问题是否准确,然后在不提供视频的情况下,直接用 LLM 回答文本问题,找到那些无需视觉信息就能正确作答的问题,打回修改
接着是对数据集的统计分析,这里不再详细说明。
实验
作者选取了三类不同的模型来做实验:
- 开源/闭源图片模型
- 开源视频模型
- 闭源模型
主实验
作者使用模型的默认配置,并尽可能使用更多的帧。
实验结果显示:闭源模型 Gemini 1.5 Pro 最强,开源模型和闭源模型之间仍有很大差距;图像模型中表现最好的击败了许多视频模型。
多模态输入
作者实验了在短、中、长视频条件下分别加入字幕和音频时 Gemini 1.5 Pro 的表现,结果显示:
- 字幕和音频可以提高模型能力
- 字幕和音频在长视频中提供的帮助比短视频中提供的帮助要多
- 使用字幕要比音频更高效
不同视频长度下的表现
在主实验中,我们可以发现,随着视频长度的增加,模型的表现会显著降低,这背后有 3 个原因:
- 从 benchmark 本身来看,长视频上相关的困难任务更多
- 目前的模型更多用的是固定帧采样,而不是固定 fps 采样,导致长视频上采样稀疏,无法获得所有有用的视觉信息,可以通过引入额外的模态信息弥补缺失的信息
- 长上下文理解本身就很难
讨论
从 benchmark 结果来看,未来的工作可以从以下两个有潜力的方向去改进:
- 提高 MLLMs 对长上下文的建模能力:Ring Attention, Training-Free Context Extension, Temporal Q-Former
- 构建带有复杂时序理解的数据集:目前的视频数据集太少了,相较于文本和图像数据集来说
结论
Video-MME 提供了多样种类、不同时长以及多模态的视频数据,并标注了高质量的 QA 对。未来工作可以探索让 MLLMs 理解长上下文数据的技术。
然而,直到目前,长视频理解仍然进展缓慢。