1.提出问题?
多数 MLLM 只处理秒级短视频,面对分钟到小时级的长视频,模型记不住、推不动、上下文装不下,而当时没人说清楚 "长" 到底难在哪。
2.解决问题?
把时间推理分成四级粒度 —— 空间感知 → 事件内 → 事件间 → 长期依赖;梳理三代 MM-LLM 架构(早期视频理解模型、多模态 LLM、长视频专用模型)各自的能力边界,并对比长视频评测基准。
3.成果。
给出了 "长视频理解难度阶梯",并指出当前模型在事件间推理和长期依赖上明显薄弱,为后续长视频 benchmark 和模型设计指明了缺口。
4.启发
现在的模型不能完全理解长视频,要么上下文装不下,要么装下了理解不了视频、处理的太慢了。