1.提出问题?

90 分钟视频 ≈ 5400 万 token,而 LLM 上下文一般只有 128K;视觉 token 占总序列 80% 以上,其中超一半注意力极小,是纯浪费。

2.解决问题?

按机制分四大类 ——Transformation(pixel unshuffle / 池化 / 插值 / 卷积,无参数,一般压到 25%)、Similarity-based(合并相似 token)、Attention-based(剪掉低注意力 token)、Query-based(Q-Former 等可学习查询,压缩率 95%+)。

3.成果

首次统一对比四类方法的性能 - 效率权衡:无参方法零开销但压缩率固定,可学习方法压缩率高但要额外训练。后续研究直接按这张地图选方案。

4.启发

性能 - 效率的 trade-off 是可以量化的贡献点:不要只报压缩率,要报 "压到 X% 时任务性能掉多少、推理快多少"。

无参方法(pixel unshuffle / 池化)零开销但压缩率固定,可学习方法(Q-Former)压缩率高但要训练 —— 选型要看你的场景缺算力还是缺精度。