1,提出问题?

已有视频基准要么只测短视频片段(几秒到 3 分钟),要么 "名义上是长视频、实际看一小段就能答";且现代 LLM 先验知识太强,很多题不看视频也能蒙对。怎么设计一套真正需要跨时间片段综合推理、且排除语言先验作弊的小时级评测。

2.解决问题?

  1. 任务套件:4 大任务、18 个子任务 ——Summarization(时序排序 / 关键事件 / 对比)、Perception(事实回忆 / 序列回忆 / 时间距离 / 跟踪)、Visual Reasoning(空间 / 时间 / 预测 / 因果 / 反事实)、Navigation(房间到房间 / 物体检索)。每个子任务都用手工设计的 "问题原型" 保证答案必须跨多个时间片段才能得出。

  2. 五阶段数据管线(800+ 小时人力):

    ① 人工筛选视频(1470→500);② LLM 生成题目(25 个任务专属 prompt,20 分钟分段 + 结构化叙述);③ 人工反馈修正(7 人,400+ 小时,修正错误答案和噪声叙述);④ 盲过滤:用两个不看视频的 LLM(GPT-4/GPT-4-turbo)试答,能答对的题全部删除;⑤ 专家精修(4 人,300+ 小时)。

    因果 / 反事实 / 布局 / 导航类题目发现 LLM 生成质量不行,改由专家纯手工生成(658 题)。

3.成果

4.启发

论文自己在 Limitations 里承认 —— 没有音频模态、缺乏体育 / YouTube 等多样视频源。

sota