1.提出问题?
当时主流视频 QA 基准大多是 "静态图像思维",考的是单帧,测不出动态理解;需要覆盖广泛动态能力的基准。
2.解决问题?
定义从静态到动态难度递增的 20 个任务(含时序、事件、因果关系等);用 "自动转多选题" 机制从现有标注数据低成本生成可自动评测的题目,保证公平可复现。
3.成果
开源模型(最佳 VideoChat2 约 60.4%)与商业模型差距明显;已成为视频理解评测的标准参考之一。
4.启发
防作弊要从评测设计源头做起:自动转多选题这个机制让 benchmark 可自动评测、可复现,这是基准能被广泛采用的前提。
任务设计要覆盖 "动态理解"(时序、事件、因果),只测单帧的基准没有区分度。