1.为什么要做Video-MME
现有基准的问题存在问题,比如:
(1)视频类型单一:大多来自实验室场景或单一领域;
(2)时间覆盖不足:平均只有几秒到十几秒(MSRVTT 15s、MVBench 16s),缺乏长视频;
(3)模态单一:只用视频帧,忽略了字幕、音频这些现实视频天然携带的信息;
(4)标注昂贵:多靠自动生成或众包,质量参差。
一句话:当时的 MLLM 评测就像只考 "看图说话",没人系统考 "看懂动态世界" 的能力。
2.怎么做的?
设计一:视频类型多样性
从 YouTube 构建 6 大领域 × 30 个子类 的层级体系:知识、影视、体育竞技、艺术表演、生活记录、多语言(含科技、纪录片、电竞、魔术、时尚等)。
设计二:时长全谱(这是与所有前作最大的区别)
短中长各300个视频。
设计三:模态广度
900 个视频全部配音频,744 个配有字幕 —— 支持 "纯帧 / 帧 + 字幕 / 帧 + 音频" 三种评测设置。
设计四:专家人工标注的质量控制
每位标注者完整看完整个视频后,迭代写出 3 道多选题(4 个选项)
交叉审查:换人复核语言、逻辑、答案正确性
"必须看视频" 过滤:把题干单独喂给 Gemini 1.5 Pro,凡是不看视频就能答对的题全部剔除(最终纯文字正确率 <15%)
证书长度(certificate length)分析:短 / 中 / 长视频需要看 26s / 164.7s / 890.7s 的视频才能确定答案 —— 比 EgoSchema(~100s)难得多,论文称这是迄今最具挑战性的视频 QA 数据集
3.实验成果
①发布了首个可同时评估图像 / 视频 MLLM 的全频谱基准;②揭示关键事实:Gemini 1.5 Pro 最强(75%)、开源落后 16 分、字幕 / 音频显著提效(长视频 +10.1%)、所有模型随视频变长而退化;③给出未来方向:长上下文建模(ring attention、temporal Q-Former)与复杂时间推理训练数据
4.启发
长上下文问题一直是长视频理解方面的巨大难题,可以从token压缩方面入手。
现在也缺少复杂时间推理的训练数据,一种想法是自己构建一个有复杂时间关系的benchmark,并提出基准模型。