1.提出问题?

视频基础模型该怎么训练?掩码方案怎么设计?不同范式效果差多少?缺一份系统的横向梳理。

2.解决问题?

把掩码重建细分为离散 token 掩码(VQGAN+dVAE,如 BeVT、MAM2)和随机掩码(如 ST-MAE、VideoMAE、VideoMAEv2 的双掩码策略),并覆盖对比学习等其他训练范式。

3.成果

给出完整分类;最反直觉的发现是 —— 纯图像预训练模型在很多视频任务上反超纯视频模型,原因是图像数据量远大于视频。通用模型 > 专用模型的趋势被实证。

4.启发

图像预训练反超纯视频模型" 说明:数据量有时比模型设计更关键。做视频任务不必死磕视频专用模型,走 "海量图像预训练 + 视频微调" 能省大量算力和数据成本。

通用模型正在碾压专用模型 —— 做方法时优先考虑通用架构上的改进,而不是另起炉灶。