1.为什么要做Video-MME

现有基准的问题存在问题,比如:
(1)视频类型单一:大多来自实验室场景或单一领域;

(2)时间覆盖不足:平均只有几秒到十几秒(MSRVTT 15s、MVBench 16s),缺乏长视频;

(3)模态单一:只用视频帧,忽略了字幕、音频这些现实视频天然携带的信息;

(4)标注昂贵:多靠自动生成或众包,质量参差。

一句话:当时的 MLLM 评测就像只考 "看图说话",没人系统考 "看懂动态世界" 的能力。

2.怎么做的?

设计一:视频类型多样性

从 YouTube 构建 6 大领域 × 30 个子类 的层级体系:知识、影视、体育竞技、艺术表演、生活记录、多语言(含科技、纪录片、电竞、魔术、时尚等)。

设计二:时长全谱(这是与所有前作最大的区别)

短中长各300个视频。

设计三:模态广度

900 个视频全部配音频,744 个配有字幕 —— 支持 "纯帧 / 帧 + 字幕 / 帧 + 音频" 三种评测设置。

设计四:专家人工标注的质量控制

3.实验成果
①发布了首个可同时评估图像 / 视频 MLLM 的全频谱基准;②揭示关键事实:Gemini 1.5 Pro 最强(75%)、开源落后 16 分、字幕 / 音频显著提效(长视频 +10.1%)、所有模型随视频变长而退化;③给出未来方向:长上下文建模(ring attention、temporal Q-Former)与复杂时间推理训练数据

4.启发

长上下文问题一直是长视频理解方面的巨大难题,可以从token压缩方面入手。

现在也缺少复杂时间推理的训练数据,一种想法是自己构建一个有复杂时间关系的benchmark,并提出基准模型。