论文阅读与技术实践
知行札记
这里记录论文阅读、技术实验与工程复盘。每篇笔记都尽量说清楚:它解决了什么、为什么有效,以及怎样真正用起来。
知识索引
查找文章
共 8 篇文章
没有找到匹配的文章,请调整关键词或重置筛选。
论文笔记
综述
MVBench:一个综合的多模态视频理解基准
面向多模态大模型的视频理解综合评测基准,包含 20 个任务。
综述
多模态大语言模型的高效令牌压缩调查
多模态大模型 Token 压缩方法综述,回答 "视觉 token 太多怎么省"。
综述
视频基础模型
视频基础模型(ViFM)综述,重点讲自监督预训练,尤其是掩码重建类方法。
综述
从秒到小时:评测多模态大型语言模型对长视频理解的表现
聚焦 "长视频理解" 的多模态大模型综述,核心贡献是提出时间推理粒度的分层框架。
综述
基于大语言模型的视频理解综述
第一篇系统梳理 "用 LLM 做视频理解" 的综述,提出统一分类框架,并汇总了视频理解任务、数据集和评测指标。
长视频Benchmark
LVBench:一个极端长视频理解基准
针对极端长视频(平均 68 分钟)的评测基准:103 个视频(共 117 小时)+ 1,549 道专家人工标注题,提出六大核心时间理解能力框架
长视频Benchmark
LONGVIDEOBENCH:一个用于长上下文交错视频-语言理解的基准
提出 referring reasoning(指称推理)任务 + 长视频交错理解基准:3,763 个视频(最长 1 小时)+ 6,678 道人工标注多选题 + 17 个细分类别
长视频Benchmark
Video-MME:首个多模态大语言模型视频分析综合评测基准
首个全频谱(full-spectrum)多模态视频理解评测基准:900 视频、2700 道人工标注多选题
技术文章
关于
我关注计算机视觉、长视频理解方向,以及如何把复杂概念解释清楚。
写作是检验理解的一种方式。这个网站会持续收录论文阅读笔记、技术实践与阶段性思考,也会保留观点变化的过程。