ESC
输入关键词搜索文章
目录

VideoMAE 论文精读

NeurIPS 2022 Spotlight · 数据高效的视频自监督预训练
tube masking + 90% 掩码率:第一个纯 ViT 自监督预训练视频 Transformer。
90%掩码率
3.2×训练加速
87.4%K400 Top-1
3.5k极小数据集
一句话读懂:VideoMAE 把图像 MAE「mask 75% 再重建像素」的范式迁移到视频,提出 tube masking(沿时间轴共享 mask 图)+ 90% 极高掩码率的两个关键设计,用纯 vanilla ViT 在 K400 / SSV2 / UCF101 / HMDB51 上以「不借助 ImageNet 预训练、不借助额外 tokenizer」的方式同时超越同期所有对比学习与监督预训练方法,并且在 HMDB51 这种只有 3.5k 训练视频的极小数据集上把自监督优势再放大到一个数量级。#Tong-et-al.-2022

系列定位

本文是动作识别系列论文精读第一篇,是视频自监督路线下 VideoMAE 论文的完整深读。

推荐阅读路径:先读本篇建立对「mask + reconstruct in pixel space」这一 SSVP 范式的直觉,再去读同作者群的 VideoMAE V2(NeurIPS 2023)看该范式如何被推到亿级参数。

Chapter 1 · 引言与问题
为什么视频 Transformer 需要一种新的自监督范式?

视频 Transformer 训练的现实困境

视觉 Transformer(ViT)自从 2020 年被提出以来,迅速在图像分类、目标检测、语义分割、目标跟踪、视频识别等任务上刷新精度,但视频 Transformer 的训练路线始终没有「自立」。一个公开的秘密是:

早在 TimeSformer 和 ViViT 出现时(2021 年),作者们就发现 纯时空自注意力的视频 Transformer 无法从零训练,必须先借助 ImageNet-21K 等大规模图像数据集做监督预训练,再把 2D 权重膨胀到 3D。这是 ViT 论文 #Dosovitskiy-et-al.-2020 留给视频社区的核心痛点 —— TimeSformer 在仅靠视频数据训练时精度落后 ImageNet 预训练版本 10 个百分点以上,ViViT 也得到类似结论。唯一一个例外是 MViT(Fan et al., 2021),但它依赖强 stage-by-stage 的池化归纳偏置,已经偏离了「纯 Transformer」的本意。

换句话说,2022 年初的视频 Transformer 有一个尴尬的事实:所有 SOTA 模型要么是 CNN(SlowFast、X3D),要么是依赖 2D 图像预训练的 Transformer。视频数据本身的丰富性似乎被忽视了。

自监督学习能解决吗?已有的两条路径都有局限

自监督视频预训练(SSVP)已经有两条主流路线:

  • 前置任务路线(OPN, VCOP, SpeedNet):设计帧序、帧率、循环排序等「人为任务」,但任务难度低、迁移性差。
  • 对比学习路线(MemDPC, CoCLR, VideoMoCo, CVRL, RSPNet):用大 batch + 强 augment 拉近正样本远离负样本,已是 2020-2022 年的主流,但在视频上 严重依赖 batch size,训练动辄需要 1024 块 GPU。

2022 年前后也存在两个 同样尝试把 MAE 思路搬到视频 的同期平行工作:BEVT#Wang-et-al.-2022-BEVT(NeurIPS 2022)和 VIMPAC#Tan-et-al.-2022-VIMPAC(NeurIPS 2022)。BEVT 在 ImageNet-1K + Kinetics 上做 MAE 风格预训练但预测 DALL-E token,VIMPAC 使用 HowTo100M 文本监督。同期还有 MaskFeat#Wei-et-al.-2021(MViT 骨干 + 重建 HOG 特征)。VideoMAE 与它们的根本差异是:纯 ViT + pixel MSE + 不需外部数据或 tokenizer

论文作者来自 MCG-NJU 实验室(南京大学王利民教授课题组)与腾讯 AI Lab,他们在 NeurIPS 2022 的这篇文章里#Tong-et-al.-2022做了一个很「朴素」的实验:把图像 MAE(He et al., 2021,#he2021masked)的直接做法搬到视频上,不要 2D 预训练、不要对比损失、不要强 augment。然后加了两个看似简单实则精准的设计改动:tube masking90% 极高掩码率,就拿到了 SSV2 与 K400 的新 SOTA,并把对比学习的 wall-clock time 砍掉 3.2×。

VideoMAE Pipeline 概览
VideoMAE 整体 Pipeline:1) temporal downsample 16 帧;2) cube embedding(2×16×16 一个 token);3) tube masking 90%(mask 沿时间轴共享);4) vanilla ViT-B encoder 仅接收 10% tokens;5) 4-block shallow decoder 重建像素;6) MSE on masked pixels only。来源:VideoMAE 论文 Fig. 1。

本文核心贡献(论文摘要原文)

作者在 abstract 中给出三个关键论断,下文将逐一验证其数字与机制:

  1. 极高掩码率仍有效:90%—95% 的掩码率在视频上仍能给出良好性能,因为视频的时间冗余允许这种程度的遮挡。
  2. 数据高效:VideoMAE 在大约 3k—4k 个视频的小数据集上不借助任何额外数据就能训练,这主要归功于像素重建任务的挑战性迫使网络学到高层结构。
  3. 质量 > 数量:在 SSVP 中数据质量比数据数量更重要,源域与目标域之间的 domain shift 是重要因素。
反直觉预告:在 Something-Something V2 上,把预训练数据从 169k 缩小到仅 42k(远小于 Kinetics 的 240k),竟然比用 240k Kinetics 预训练后再 fine-tune 的结果还好(68.7% vs 68.5%)。这违背「数据越多越好」的直觉,正是 domain shift 假说的有力证据。
Chapter 2 · 前置知识
图像 MAE:VideoMAE 的算法祖先

VideoMAE 是图像 MAE(He et al., 2021,arXiv:2111.06377)在视频维度的直接继承。在理解 VideoMAE 之前必须先理解两件事:什么是「masked autoencoder」以及为什么图像 MAE 在 75% 掩码率下能学到好表示。

MAE 的两个核心机制

  1. 非对称 encoder-decoder。Encoder 只接收「可见的」patch tokens(约 25%),计算量大幅减少;Decoder 是一个轻量 Transformer(或几层 MLP),把可见 tokens 与 learnable mask tokens 一起拼接,恢复被 mask 的 patch 的像素。
  2. MSE on masked pixels。损失只在被 mask 的 patch 上计算像素级 MSE,公式为:
    $$\mathcal{L} = \frac{1}{\Omega} \sum_{p \in \Omega} \left\| I(p) - \hat{I}(p) \right\|_2^2$$

    其中 \(I(p)\) 是原始图像在 token \(p\) 处的像素,\(\hat{I}(p)\) 是 decoder 的重建,\(\Omega\) 是被 mask 的 token 集合。

MAE 在 ImageNet 上达到 87.8% top-1(ViT-L),证明纯像素重建目标能够学到足以迁移的下游表征。VideoMAE 的核心赌注是:视频 = 「带时间轴的图像」,所以 MAE 在视频上也能 work。但视频有两个固有性质让这条路不能直搬,需要做改造。

视频的两个固有性质(论文 §3.2)

  • 时间冗余(Temporal Redundancy)。视频帧是密集采样的,相邻帧的语义变化缓慢(slowness prior,Goroshin et al., 2015)。这意味着在普通 75% 掩码率下,encoder 可能直接通过「从邻接帧拷贝对应位置像素」走捷径,而不必学到高层语义。
  • 时间相关性(Temporal Correlation)。同一空间坐标在相邻帧常常几乎相同(背景、前景静止部分)。这造成「帧间信息泄露」:即使做了 random masking,被 mask 的 cube 在相邻未 mask 帧里几乎能找到完全相同的拷贝。
不同 masking 策略对比
三种 masking 策略对比。从左到右:原始帧序列、frame masking(整帧丢弃)、random masking(逐 cube 独立抽样)、tube masking(沿 t 轴 mask map 共享)。frame masking 与 random masking 都给模型留下了「邻帧相同坐标拷贝」的捷径;只有 tube masking 强迫模型做跨时间的推理。来源:VideoMAE 论文 Fig. 2。

这两个性质意味着:直接把 ImageMAE 套到视频上,必然导致 encoder 学到「短期低层次复制」的捷径。VideoMAE 的两个核心设计正是为了打破这两条捷径。

Chapter 3 · 模型结构
VideoMAE 架构:从 cube embedding 到 masked reconstruction

3.1 整体 Pipeline

Video clip V (1×t×H×W×3)
   │
   ├─ temporal downsample ─→  X ∈ ℝ^{T×H×W×3}, T=16, stride τ
   │     (τ=4 for K400, τ=2 for SSV2)
   │
   ├─ cube embedding (patch=2×16×16, linear proj to D=768)
   │     ─→ tokens ∈ ℝ^{(T/2)×(H/16)×(W/16) × D}
   │
   ├─ tube masking: m_{x,y} ~ Bernoulli(ρ), ρ=0.90, shared across t
   │     ─→ keep only (1−ρ)=10% of tokens
   │
   ├─ Encoder Φ_enc: 12-block vanilla ViT-B, joint space-time MHA
   │     ─→ latent z ∈ ℝ^{N_keep×D}
   │
   ├─ concat with learnable mask tokens
   │
   ├─ Decoder Φ_dec: 4-block ViT, dim=384 (= D/2)
   │     ─→ predicted cube pixels Ŷ ∈ ℝ^{T×H×W×3}
   │
   └─ MSE loss: (1/Ω) · Σ ‖X(p) − Ŷ(p)‖² ,  only over masked tokens

3.2 Tube masking 的数学形式

Tube masking 的关键在于:把 mask 的随机性限制在 2D 空间 (x, y) 上,然后沿 t 复制。三维索引 \((t, x, y)\) 的 mask 决策可表示为:

$$\mathbb{I} \left[ p_{(x, y, \cdot)} \in \Omega \right] \sim \mathrm{Bernoulli}(\rho_{\mathrm{mask}}), \quad \forall\, t$$

换言之,mask 图(mask map)是一个仅在 (x, y) 平面上的二值图,对所有 t 共享。被 mask 的位置形成一个沿时间轴穿透的「管子(tube)」,空心管子里所有 t 帧的同一个 (x, y) 都被一起掩码。

为什么 tube masking 比 random masking 更难走捷径?

在 random masking 下,模型可能做这样的「填空」:frame 0 的 (x1, y1) 被 mask,但 frame 1 的 (x1, y1) 仍是 visible ⇒ 模型可以从 (x1, y1, frame 1) 拷贝像素直接填空,反正它俩在背景区域几乎完全一致。

在 tube masking 下,frame 0、1、2、... 都同时 mask 同一 (x, y) 位置,模型 必须在不同的 (x', y') 坐标或不同语义区域的 tokens 上寻找上下文,这就强迫它学到跨时间的语义推理,而不是低层像素拷贝。

3.3 90% 极高掩码率的合理性

视频的信息密度远低于单张图像(同样像素数下,图像承载的语义结构更多),这意味着即使遮掉 90% 的 cube,剩余 10% 的 tokens 仍可能携带足以恢复关键时空结构的线索。

实验证据:在 SSV2 上把 tube masking ratio 从 75% 提到 90%,准确率从 68.0% → 69.6%(+1.6 个百分点);在 K400 上同样最优(80.0%)。即使 95% 的掩码率都仍能给出合理性能(Fig. 4)。这与图像 MAE 的 75% 经验最优值形成鲜明对比 —— 视频的「语义密度低 + 时空结构可压缩」是高掩码率的物理基础。

3.4 Joint Space-Time Attention vs Divided Attention

VideoMAE 选择 joint space-time attention(所有 tokens 在同一个 multi-head self-attention 里互相 attend),与 ViViT 一致。理论上 divided attention(先 spatial 后 temporal)更省 FLOPs,但 VideoMAE 的 90% 掩码率使得 encoder 实际处理的 token 数仅 10% —— 这时 divided attention 的相对收益下降,而 joint attention 让剩余 tokens 之间充分交互,能更高效地利用宝贵的可见信息。

3.5 Decoder 设计:4 blocks 的反直觉选择

ImageMAE 用 1-block decoder 就足够,但 VideoMAE 在 Tab. 11 的 ablation 发现 4-block decoder 是精度-显存的最优平衡:

Decoder blocksSSV2K400GPU mem (1 GPU, bs=16)
168.579.07.9G
269.279.210.2G
4(默认)69.680.014.7G
869.379.723.7G

视频任务需要比图像更深的 decoder 来恢复高维时空结构,但 8 blocks 已陷入边际效益递减。作者最终采用 4 blocks,宽度为 encoder 的一半(ViT-B:encoder 768-d,decoder 384-d)。

VideoMAE Pipeline 架构图
Encoder-Decoder 非对称架构示意图。Encoder 仅接收 10% 的 visible tokens,decoder 把 latent 与 learnable mask tokens 拼接恢复全部 cube 像素。来源:VideoMAE 论文 Fig. 1。
Chapter 4 · 训练流程
预训练与微调:超参、数据集、anti-leak 配置

4.1 预训练配置(论文 Tab. 13)

配置SSV2K400
OptimizerAdamW
Base learning rate1.5e-4(按 batch=256 的 linear scaling)
Weight decay0.05
β₁, β₂0.9, 0.95
Batch size1024
LR schedulecosine decay
Warmup epochs40
Flip augmentationnoyes
AugMultiScaleCrop
Masking ratio ρ90%(UCF/HMDB 用 75%)
Pre-train epochs800(主 ablation)/ 2400(主 SOTA)800
Hardware64 V100 GPUs64 V100 GPUs

为什么 SSV2 关闭 flip augmentation?

SSV2 是 motion-centric 数据集,类标签对方向敏感(如 「Push something from left to right」「right to left」 是两个不同类)。如果使用 random horizontal flip,等价于数据增强把标签语义破坏掉,模型无法学到正确动作。论文作者对此专门在 SSV2 关闭 flip,K400 则保留。

4.2 微调配置(Tab. 14)

配置SSV2K400
OptimizerAdamW
Base LR1e-3 (ViT-S), 5e-4 (B, L)1e-3
Training epochs40 (S, B), 30 (L)150 (S), 75 (B), 50 (L, H)
Warmup epochs5
Repeated augmentation2
Mixup / Cutmix0.8 / 1.0
Label smoothing0.1
Drop path0.1 (S, B), 0.2 (L, H)
Layer-wise LR decay0.7 (S), 0.75 (B, L, H)
Samplinguniform (TSN 风格)dense (SlowFast 风格)
Inference views2 clips × 3 crops5 clips × 3 crops

Layer-wise LR decay(LLRD,0.7-0.75)是 ViT fine-tune 的关键技巧 —— 让浅层学习率小、深层学习率大,稳定 fine-tune 收敛。这一设计在 BEiT 中首次系统化,VideoMAE 直接借鉴。

4.3 小数据集(UCF101 / HMDB51)的特殊配方

对极小的数据集,作者 主动调高预训练 epoch、降低 masking ratio,让小数据上的训练更稳定:

数据集训练样本数预训练 masking ratio预训练 epochsbatchbase LR微调 epoch
UCF1019.5k75%32001923e-4100, bs=128
HMDB513.5k75%48001923e-450, bs=128

注:K400/SSV2 主表用 90%,但 UCF/HMDB 因为只有数千视频、训不下去那么激进的掩码率。这是工程上很务实的调整 —— 「不要把大模型的设计在小数据上硬搬」。

Chapter 5 · 推理与下游
Linear probing 与跨数据集迁移

5.1 推理协议

VideoMAE 的 inference 流程与传统 video Transformer 完全一致 —— 部署时只保留 encoder,decoder 被丢弃,encoder 输出后接一个 linear classifier。具体而言:

  • SSV2:uniform sampling(按 TSN),2 clips × 3 crops = 6 views。
  • K400:dense sampling(按 SlowFast),5 clips × 3 crops = 15 views。
  • UCF101:5 clips × 3 crops。
  • HMDB51:10 clips × 3 crops(数据集较小需要更多视角平均)。

5.2 Linear Probing:自监督特征的独立验证

SSV2 上 linear probing 设置(Tab. 15):

方法Pre-train epochsFine-tune acc.Linear probing acc.
MoCo v330054.233.7
VideoMAE80069.638.9

linear probing(冻结 encoder,只训练最后一层 linear classifier)是衡量自监督表征质量的「硬指标」。VideoMAE 的 38.9 > MoCo v3 的 33.7 说明它学到的特征质量更高。但更值得注意的是 fine-tune 与 linear 的差距(30.7 vs 5.2 个百分点),意味着 VideoMAE 表征与下游任务需要更精细地调谐才能发挥。

5.3 跨数据集迁移(Tab. 5 transferability)

方法K400→SSV2K400→UCFK400→HMDB
MoCo v362.493.267.9
VideoMAE68.596.173.3

K400 预训练后迁移到 UCF/HMDB 时,VideoMAE 的精度甚至超过在 UCF/HMDB 自身预训练的版本(K400→UCF 96.1 vs UCF-self 91.3;K400→HMDB 73.3 vs HMDB-self 62.6)。但同样的迁移到 SSV2 时却反过来(68.5 < 69.6)。这个看似矛盾的结果正是 domain shift 论断的来源 —— 当源域与目标域的语义结构高度不同时(如 SSV2 看手势 vs K400 看场景),同域预训练更有效;当语义相近时(K400 与 UCF/HMDB 都是场景级动作分类),大规模跨域预训练是更好的特征起点

Chapter 6 · 实验结果
消融、效率、对比 SOTA:四个最关键发现

6.1 最高优先级发现:90% 掩码率真有效(Fig. 4)

掩码率消融 SSV2
SSV2 上 masking ratio 与 top-1 精度的关系。90% 是最优,95% 仍能给出合理性能。曲线来源:VideoMAE 论文 Fig. 4(a)。
掩码率消融 K400
K400 上同样的 90% 拐点。曲线来源:VideoMAE 论文 Fig. 4(b)。

反直觉的是 90% 不是局部最优,而是「很尖锐」的最优点 —— 即使在 88% 之上进入 95%,精度也只是缓慢下降而非崩塌。这跟 MAE 在图像上 75% 是锐利拐点、低于 60% 就开始掉点的形态完全不同。

6.2 第二优先级发现:Tube > Random > Frame(Tab. 2 mask_types)

策略掩码率SSV2K400
tube75%68.079.8
tube(默认)90%69.680.0
random90%68.379.5
frame87.5%(mask 14/16 帧)61.576.5

注意最后一行:frame masking 即使掩码率高达 87.5%(远高于 tube 的 90%),但在 SSV2 上仍然掉 8.1 个百分点(69.6 → 61.5)。这直接证明 frame masking 让模型走捷径完全成立 —— 它甚至不是「重建难」问题,而是「encoder 学到的特征没有用」。Tube masking 比 random masking 在 SSV2 上高 1.3 个百分点,差距虽小但稳定。

6.3 第三优先级发现:3.5k 视频即可训练(Tab. 4)

训练数据规模数据集from scratchMoCo v3VideoMAE
240kK40068.874.280.0
169kSSV232.654.269.6
9.5kUCF10151.481.791.3
3.5kHMDB5118.039.262.6
数据效率的硬数字:在 HMDB51(仅 3.5k 训练视频)上,VideoMAE 比 from-scratch 高出 +44.6 个百分点,比 MoCo v3 高出 +23.4 个百分点。这个差距比在 K400 上(10 个百分点)放大了 4×,证实了论文标题的关键词 —— Data-Efficient Learner

6.4 第四优先级发现:训练效率(Tab. 3)

方法epochsft acclin acchours (64 V100)speedup
MoCo v330054.233.761.7
VideoMAE80069.638.919.53.2×

VideoMAE 需要更多 epoch(800 vs 300)但 总时长反而更短 —— 因为 90% 掩码率让 encoder 只处理 10% tokens,decoder 又极轻量(4 blocks, 384-d)。这对工业界是大好消息:自监督预训练不需要 1024 块 GPU,64 块 V100 跑 19.5 小时即可。

6.5 主表 SOTA:与同期工作横评(Tab. 5-7)

SSV2(不使用额外数据),VideoMAE ViT-L 16×4 = 74.3%,ViT-L 32 帧 = 75.4%,均为同期无外部数据 SOTA。同期对照:

方法BackboneExtra dataEx. labelsTop-1
BEVTSwin-BIN-1K+K400+DALLE70.6
MaskFeat↑312MViT-LK60075.0
VIMPACViT-LHowTo100M+DALLE68.1
VideoMAE(无外部数据)ViT-Lnone74.3
VideoMAE(32 帧)ViT-Lnone75.4

K400(不使用额外数据),VideoMAE ViT-L 16×4 = 85.2%,已经超过依赖 IN-21K 的 TimeSformer/ViViT/Motionformer/Video Swin:

方法BackboneExtra dataTop-1
TimeSformerViT-LIN-21K80.7
ViViT FEViT-LIN-21K81.7
Video SwinSwin-LIN-21K83.1
ViViT FEViT-LJFT-300M83.5
MaskFeatMViT-Lnone84.3
VideoMAEViT-Lnone85.2
VideoMAE(更长 schedule)ViT-Lnone86.1
VideoMAEViT-Hnone86.6
VideoMAE↑320(高分辨)ViT-Hnone87.4

87.4% 是 abstract 中宣称的最高 K400 top-1,对应 ViT-H + 320×320 高分辨率 fine-tune + 32 帧 输入。即使如此,ViT-B/L 的主表数字 81.5 / 85.2 / 86.1 已经是同期不用任何额外数据的最强 baseline,而 ViT-H 的 87.4 进一步证明了「纯像素重建」的可扩展性。

6.6 重建可视化:90% 掩码率下仍可重建(Fig. 7)

VideoMAE 重建结果示例
在不同 masking ratio(50/75/90%)下的重建结果。即使 90% 掩码率 VideoMAE 仍能恢复清晰的运动结构与人物轮廓。来源:VideoMAE 论文 Fig. 7。

重建可视化是论文叙事中最具说服力的一组证据。即使在 90% cube 缺失的情况下,重建出的视频仍保留人物外形、运动方向与场景几何,说明 encoder 真正学到了「时空的语义骨架」而非低层次纹理。

6.7 AVA 动作检测(Tab. 4):泛化到 detection

把 K400 预训练权重转到 AVA v2.2(动作检测而非分类),ViT-B + 无额外 fine-tune 即可达到 26.7 mAP,再 fine-tune K400 标签后 transfer 可达 31.8 mAP;ViT-H 冲到 39.5 mAP,逼近同期 MaskFeat MViT-L + K600 fine-tune 的 38.8。这一结果验证了 VideoMAE 学到的表征在 分类以外的时空定位任务 同样有效。

Chapter 7 · 讨论与启发
为什么 VideoMAE 重要:理论意义、局限与后续

7.1 三个理论贡献

  1. 像素重建的范式力量。在 NLP(BERT)和 image(MAE)上都被验证过的 masked autoencoding,在视频上同样奏效 ——「重建」是一个跨模态的通用预训练信号。
  2. 时间结构可以通过纯自监督学到。Tube masking 不借助光流、frame difference 等手工特征,就能让 vanilla ViT 学到跨时间的语义推理,意味着自监督对时间结构是可探索的。
  3. 数据质量权重 > 数据数量。源-目标 domain shift 的发现提示我们:在 SSVP 中,相比盲目扩大数据集,优先选择与下游任务同分布的数据可能更划算。

7.2 与 BEVT / VIMPAC / MaskFeat 的关键区别

方法骨干预训练目标是否需要额外 tokenizer是否需额外数据
VideoMAEpure ViTpixel MSE
BEVTSwin Transformer预测 DALL-E token + 重建像素是(DALL-E)是(IN-1K+K400)
VIMPACViT-L预测 DALL-E token是(DALL-E)是(HowTo100M)
MaskFeatMViT-L重建 HOG 特征可选 K600

VideoMAE 的「最小依赖」属性 —— 纯 ViT 骨干 + pixel MSE + 无额外 tokenizer + 无额外数据 —— 使它在工程上最容易复现,也最容易扩展到下游任务。

7.3 局限与未解决问题

  • 极高掩码率并不普适。90% 的「最优」仅在 dense-temporally-redundant 数据集上有效;当动作变化快或场景切换剧烈时,更高掩码率可能反而拖累。
  • 重建目标与识别目标的 gap。论文 §6 分析类别增益时发现,对「small motion object」(如小手指动作)VideoMAE 重建变差 —— 因为小目标的所有 cubes 都被 mask 后,encoder 缺乏线索。这指向 重建 ≠ 识别 的潜在偏差。
  • decoder depth 还需要更多研究。视频 MAE 与图像 MAE 在 decoder 深度上的差异(4 vs 1)目前没有理论解释,是经验观察。

7.4 后续工作的关键血缘

  • VideoMAE V2 (NeurIPS 2023, Li/Wang et al.):同一作者群的直接扩展,加入 dual masking 与亿级参数,Kinetics 达到 92.6%。
  • UMT (CVPR 2023):在 VideoMAE 框架上叠加多模态(image+video+text)联合训练。
  • InternVideo / InternVideo2/3 (NeurIPS 2024):视频基础模型系列,把 VideoMAE 作为视觉编码器预训练阶段之一。
  • VideoPrism / VideoPoet / VideoLLaMA:Google、Meta 等的 video LLM 多采用 masked video token 作为底层视觉预训练目标。
  • MVD, SVFormer, Video-CCAM 等:在 VideoMAE 之上的半监督、压缩域扩展。

7.5 复现路线图(针对读者画像)

把 VideoMAE 当作一个「材料 + 配方」组合来看,复现的难度梯度是:

  1. 新手友好:用 官方 MCG-NJU 仓库,在 8×V100 上 3200 epoch 训 UCF101 即可拿到 91%+;这本身就是检验框架正确性的最小实验。
  2. 进阶:复现 SSV2 上的主表(70.8%)。需要 64×V100、800 epoch、90% 掩码率、tube masking、ViT-B;如果验证后精度低 1-2 个点,多半是 LR schedule 或 layer-wise lr decay 漏配。
  3. 研究级:换 tube masking 为 stochastic depth 可变宽度版本 / 探索 masked visual token 重建(BEiT 风格)/ 替换重建目标为 HOG(MaskFeat 风格)等。这些改动的 ablation 精度一般落在 0.3–0.8 个百分点之间,是稳定的实验场。

工程复现 tips

几个容易踩的坑:(1) β₂=0.95 而不是通常的 0.999 —— MAE 配方;(2) SSV2 必须关 flip;(3) cube embedding 初始化最好从 ImageMAE 的 patch embedding 沿 t 轴 average-pool;(4) DeepSpeed ZeRO-1 对 64 GPU 是必要的,否则 activation memory 把单卡打爆。

对今天读者的启发:如果你手头有「有限视频数据」+「自监督算力预算」,VideoMAE 给出的工程配方已经足够明确 —— 调高掩码率到 75-90%、用 tube masking、deeper decoder、AdamW + cosine schedule。如果数据极小(<10k),把预训练 epoch 调到 3000-5000 并相应降低 masking ratio;如果「不差钱」想再榨 1-2 个点,加 layer-wise lr decay + mixup + 充分的 fine-tune。
复习速查
一页纸回顾

VideoMAE 一页纸总结

  • 核心机制:tube masking(沿时间共享 mask map)+ 90% 极高掩码率 + vanilla ViT + pixel MSE。
  • 几何直觉:masked cube 在所有 t 帧同一 (x, y) 位置上同时消失,强迫跨时间语义推理而非邻帧拷贝。
  • 数据效率:在 3.5k 视频的 HMDB51 上比 from-scratch 高 +44.6,比 MoCo v3 高 +23.4。
  • 训练效率:比 MoCo v3 快 3.2×(19.5h vs 61.7h on 64 V100)。
  • 最强结果:K400 ViT-L 85.2%(no external data)、SSV2 ViT-L 75.4%、AVA ViT-H 39.5 mAP。
  • Decoder 配方:4 blocks, dim=384(= encoder dim / 2),显存 14.7G / batch 16 / GPU。
  • 反直觉:数据质量 > 数据数量(domain shift 决定一切);90% 掩码率在视频上竟是锐利最优。

参考来源

  • Tong, Z., Song, Y., Wang, J., & Wang, L. (2022). VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training. NeurIPS 2022. arXiv:2203.12602.
  • He, K., Chen, X., Xie, S., Li, Y., Dollár, P., & Girshick, R. (2021). Masked Autoencoders Are Scalable Vision Learners. arXiv preprint. arXiv:2111.06377.
  • Dosovitskiy, A. et al. (2020). An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. ICLR 2021. arXiv:2010.11929.
  • Arnab, A. et al. (2021). ViViT: A Video Vision Transformer. ICCV 2021. arXiv:2103.15691.
  • Bertasius, G., Wang, H., & Torresani, L. (2021). Is Space-Time Attention All You Need for Video Understanding? ICML 2021. arXiv:2102.05095.
  • Fan, H. et al. (2021). Multiscale Vision Transformers. ICCV 2021. arXiv:2104.11227.
  • Wei, C., Fan, H., Xie, S., Wu, C.-Y., Yuille, A., & Feichtenhofer, C. (2021). Masked Feature Prediction for Self-Supervised Visual Pre-Training. arXiv preprint. arXiv:2112.09175.
  • Wang, R. et al. (2022). BEVT: Bootstrapping Vision-Language Pre-training with Masked Image and Video Modeling. NeurIPS 2022. arXiv:2201.09907.
  • Tan, H. et al. (2021). VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning. NeurIPS 2022. arXiv:2106.08264.
  • Bao, H., Dong, L., Piao, S., & Wei, F. (2021). BEiT: BERT Pre-Training of Image Transformers. ICLR 2022. arXiv:2106.08254.
  • Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL 2019. arXiv:1810.04805.
  • Goroshin, R., Bruna, J., Tomioka, R., & LeCun, Y. (2015). Unsupervised Learning of Spatiotemporally Coherent Metrics. ICCV 2015. arXiv:1504.01151.
  • Carreira, J. & Zisserman, A. (2017). Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. CVPR 2017. arXiv:1705.07750.
  • Goyal, R. et al. (2017). The "Something Something" Video Database for Learning and Evaluating Compositional Actions. IEEE TPAMI.
  • Soomro, K., Zamir, A. R., & Shah, M. (2012). UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild. arXiv preprint. arXiv:1212.0402.
  • Kuehne, H. et al. (2011). HMDB: A Large Video Database for Human Motion Recognition. ICCV 2011.
  • Gu, C. et al. (2018). AVA: A Video Dataset of Spatio-temporally Localized Atomic Visual Actions. CVPR 2018.
  • MCG-NJU. (2022). VideoMAE official PyTorch implementation. github.com/MCG-NJU/VideoMAE.
  • Li, K., Wang, Y., He, Y., Li, Y., Wang, Y., Wang, L., & Qiao, Y. (2023). VideoMAE V2: Gaining a Better Video Vision Transformer with Dense Tokenized Masked Autoencoders. NeurIPS 2023. arXiv:2211.09910.