论文阅读与技术实践

知行札记

这里记录论文阅读、技术实验与工程复盘。每篇笔记都尽量说清楚:它解决了什么、为什么有效,以及怎样真正用起来。

知识索引

查找文章

从一个问题,找到一篇笔记。

共 9 篇文章

论文笔记

长视频Benchmark

HourVideo:1小时视频语言理解

斯坦福团队(李飞飞组)提出的小时级视频 - 语言理解基准。从 Ego4D 中精选 500 个第一人称视频(时长 20–120 分钟、平均 45.7 分钟),配套 12,976 个高质量五选一问题。零样本评测显示:GPT-4V(25.7%)、LLaVA-NeXT(22.3%)只比随机猜测(20%)略好,最强的 Gemini 1.5 Pro 也只有 37.3%,而人类专家达 85.0%—— 长视频理解与人类差距巨大。

综述

MVBench:一个综合的多模态视频理解基准

面向多模态大模型的视频理解综合评测基准,包含 20 个任务。

综述

多模态大语言模型的高效令牌压缩调查

多模态大模型 Token 压缩方法综述,回答 "视觉 token 太多怎么省"。

综述

视频基础模型

视频基础模型(ViFM)综述,重点讲自监督预训练,尤其是掩码重建类方法。

综述

从秒到小时:评测多模态大型语言模型对长视频理解的表现

聚焦 "长视频理解" 的多模态大模型综述,核心贡献是提出时间推理粒度的分层框架。

综述

基于大语言模型的视频理解综述

第一篇系统梳理 "用 LLM 做视频理解" 的综述,提出统一分类框架,并汇总了视频理解任务、数据集和评测指标。

长视频Benchmark

LVBench:一个极端长视频理解基准

针对极端长视频(平均 68 分钟)的评测基准:103 个视频(共 117 小时)+ 1,549 道专家人工标注题,提出六大核心时间理解能力框架

长视频Benchmark

LONGVIDEOBENCH:一个用于长上下文交错视频-语言理解的基准

提出 referring reasoning(指称推理)任务 + 长视频交错理解基准:3,763 个视频(最长 1 小时)+ 6,678 道人工标注多选题 + 17 个细分类别

长视频Benchmark

Video-MME:首个多模态大语言模型视频分析综合评测基准

首个全频谱(full-spectrum)多模态视频理解评测基准:900 视频、2700 道人工标注多选题

技术文章

关于

我关注计算机视觉、长视频理解方向,以及如何把复杂概念解释清楚。

写作是检验理解的一种方式。这个网站会持续收录论文阅读笔记、技术实践与阶段性思考,也会保留观点变化的过程。

2033160882@qq.com