1.为什么要做?

痛点一:没有衡量 "长上下文多模态" 的公共基准。 文本 LLM 的上下文从 2K 涨到 128K、百万级(Gemini-1.5-Pro),但长视频 / 长多模态输入该怎么评测,几乎是空白。

痛点二:现有视频基准有严重的 "单帧偏差"(single-frame bias)。 这是论文最尖锐的批评 ——很多视频基准的结果不随模型能处理的帧数增加而提升,也就是说模型 "多看了几帧" 根本没用,几帧甚至一帧就能答对大部分题。这导致长上下文能力无法被测量。

我们需要一个 "不多看帧就一定答不对" 的基准,否则长视频理解能力根本测不出来。

2.怎么做的?

论文把长视频理解的核心挑战拆成两个能力:

  1. 检索细节:像文本 LLM 的 "大海捞针"(NIAH)测试一样,从长输入里精准找到用户问的特定片段

  2. 关系推理:找到之后,还要把多个片段之间的时间 / 因果 / 属性关系推理出来

设计了 referring reasoning 任务范式:

问题 = 指称查询(referring query)+ 问题主体
        ↓ 指称查询指向视频中的特定时刻/片段
被指称上下文(referred context)——由帧+字幕组成
        ↓ 模型必须先"定位"这段上下文,再推理作答
 多选题(正确选项 + 干扰项)

3.成果

①首个真正打破 "单帧偏差" 的长视频基准 ——GPT-4o/Gemini 从 16→256 帧提升超 10%,证明基准有效;②全面评测 22 个模型给出排行榜与 9 条洞察(开源跟不上、视频 LMM 不如图像 LMM、LLM 主干越大越强、关系题最难等);③揭示 "指称位置越深越难" 的 NIAH 效应,为长上下文 LMM 指明方向

4.启发

单帧偏差导致大模型的真实实力发挥不出来,这篇论文设计出了关系推理的问题,使其能发挥大模型的实力。

但是,在小时级视频上,大模型的准确率还是不高。可以想办法提高小时级大模型的准确率。