1.提出问题?
但现有基准最多测到 10 分钟左右(LongVideoBench 473s、Video-MME 1018s),没有能测 "小时级" 视频的基准。原因很现实:长视频数据收集难、标注复杂度极高。
现实世界要 "看懂几小时",评测却只考 "几分钟"——LVBench 要把评测推过这个坎。
2.怎么做的?
①提出六大核心时间理解能力框架(TG/Sum/Rea/ER/EU/KIR),可组合出复合任务;②构建平均 4,101 秒的极端长视频数据集(103 视频 / 117 小时 / 6 类内容,五重质量过滤);③三阶段专家标注 + 双 LLM 纯文本过滤 + 线索时长标注,保证 1,549 题 "必须密集看视频才能答"
3.成果
①发布当时最长的视频基准,把长视频评测推到小时级;②全面评测 26 个模型:Gemini-2.5-Pro 最强(67.4%),但距人类(94.4%)差 27 分;③揭示三大问题:开源落后商业超 20 分、长视频原生模型存在指令遵循缺陷(20.9% 乱答、选 A 偏见)、帧数消融证明密集视觉输入是长视频理解的刚需
4.启发
这是一个小时级评测集,可以用来测试模型长上下文能力,也可以测试压缩token后的准确率。此外,这个评测集还分了六大类问题,可以分别测试模型的不同的能力。