VideoMAE 论文精读
系列定位
本文是动作识别系列论文精读第一篇,是视频自监督路线下 VideoMAE 论文的完整深读。
推荐阅读路径:先读本篇建立对「mask + reconstruct in pixel space」这一 SSVP 范式的直觉,再去读同作者群的 VideoMAE V2(NeurIPS 2023)看该范式如何被推到亿级参数。
视频 Transformer 训练的现实困境
视觉 Transformer(ViT)自从 2020 年被提出以来,迅速在图像分类、目标检测、语义分割、目标跟踪、视频识别等任务上刷新精度,但视频 Transformer 的训练路线始终没有「自立」。一个公开的秘密是:
早在 TimeSformer 和 ViViT 出现时(2021 年),作者们就发现 纯时空自注意力的视频 Transformer 无法从零训练,必须先借助 ImageNet-21K 等大规模图像数据集做监督预训练,再把 2D 权重膨胀到 3D。这是 ViT 论文 #Dosovitskiy-et-al.-2020 留给视频社区的核心痛点 —— TimeSformer 在仅靠视频数据训练时精度落后 ImageNet 预训练版本 10 个百分点以上,ViViT 也得到类似结论。唯一一个例外是 MViT(Fan et al., 2021),但它依赖强 stage-by-stage 的池化归纳偏置,已经偏离了「纯 Transformer」的本意。
换句话说,2022 年初的视频 Transformer 有一个尴尬的事实:所有 SOTA 模型要么是 CNN(SlowFast、X3D),要么是依赖 2D 图像预训练的 Transformer。视频数据本身的丰富性似乎被忽视了。
自监督学习能解决吗?已有的两条路径都有局限
自监督视频预训练(SSVP)已经有两条主流路线:
- 前置任务路线(OPN, VCOP, SpeedNet):设计帧序、帧率、循环排序等「人为任务」,但任务难度低、迁移性差。
- 对比学习路线(MemDPC, CoCLR, VideoMoCo, CVRL, RSPNet):用大 batch + 强 augment 拉近正样本远离负样本,已是 2020-2022 年的主流,但在视频上 严重依赖 batch size,训练动辄需要 1024 块 GPU。
2022 年前后也存在两个 同样尝试把 MAE 思路搬到视频 的同期平行工作:BEVT#Wang-et-al.-2022-BEVT(NeurIPS 2022)和 VIMPAC#Tan-et-al.-2022-VIMPAC(NeurIPS 2022)。BEVT 在 ImageNet-1K + Kinetics 上做 MAE 风格预训练但预测 DALL-E token,VIMPAC 使用 HowTo100M 文本监督。同期还有 MaskFeat#Wei-et-al.-2021(MViT 骨干 + 重建 HOG 特征)。VideoMAE 与它们的根本差异是:纯 ViT + pixel MSE + 不需外部数据或 tokenizer。
论文作者来自 MCG-NJU 实验室(南京大学王利民教授课题组)与腾讯 AI Lab,他们在 NeurIPS 2022 的这篇文章里#Tong-et-al.-2022做了一个很「朴素」的实验:把图像 MAE(He et al., 2021,#he2021masked)的直接做法搬到视频上,不要 2D 预训练、不要对比损失、不要强 augment。然后加了两个看似简单实则精准的设计改动:tube masking 和 90% 极高掩码率,就拿到了 SSV2 与 K400 的新 SOTA,并把对比学习的 wall-clock time 砍掉 3.2×。
本文核心贡献(论文摘要原文)
作者在 abstract 中给出三个关键论断,下文将逐一验证其数字与机制:
- 极高掩码率仍有效:90%—95% 的掩码率在视频上仍能给出良好性能,因为视频的时间冗余允许这种程度的遮挡。
- 数据高效:VideoMAE 在大约 3k—4k 个视频的小数据集上不借助任何额外数据就能训练,这主要归功于像素重建任务的挑战性迫使网络学到高层结构。
- 质量 > 数量:在 SSVP 中数据质量比数据数量更重要,源域与目标域之间的 domain shift 是重要因素。
VideoMAE 是图像 MAE(He et al., 2021,arXiv:2111.06377)在视频维度的直接继承。在理解 VideoMAE 之前必须先理解两件事:什么是「masked autoencoder」以及为什么图像 MAE 在 75% 掩码率下能学到好表示。
MAE 的两个核心机制
- 非对称 encoder-decoder。Encoder 只接收「可见的」patch tokens(约 25%),计算量大幅减少;Decoder 是一个轻量 Transformer(或几层 MLP),把可见 tokens 与 learnable mask tokens 一起拼接,恢复被 mask 的 patch 的像素。
- MSE on masked pixels。损失只在被 mask 的 patch 上计算像素级 MSE,公式为:
$$\mathcal{L} = \frac{1}{\Omega} \sum_{p \in \Omega} \left\| I(p) - \hat{I}(p) \right\|_2^2$$
其中 \(I(p)\) 是原始图像在 token \(p\) 处的像素,\(\hat{I}(p)\) 是 decoder 的重建,\(\Omega\) 是被 mask 的 token 集合。
MAE 在 ImageNet 上达到 87.8% top-1(ViT-L),证明纯像素重建目标能够学到足以迁移的下游表征。VideoMAE 的核心赌注是:视频 = 「带时间轴的图像」,所以 MAE 在视频上也能 work。但视频有两个固有性质让这条路不能直搬,需要做改造。
视频的两个固有性质(论文 §3.2)
- 时间冗余(Temporal Redundancy)。视频帧是密集采样的,相邻帧的语义变化缓慢(slowness prior,Goroshin et al., 2015)。这意味着在普通 75% 掩码率下,encoder 可能直接通过「从邻接帧拷贝对应位置像素」走捷径,而不必学到高层语义。
- 时间相关性(Temporal Correlation)。同一空间坐标在相邻帧常常几乎相同(背景、前景静止部分)。这造成「帧间信息泄露」:即使做了 random masking,被 mask 的 cube 在相邻未 mask 帧里几乎能找到完全相同的拷贝。
这两个性质意味着:直接把 ImageMAE 套到视频上,必然导致 encoder 学到「短期低层次复制」的捷径。VideoMAE 的两个核心设计正是为了打破这两条捷径。
3.1 整体 Pipeline
Video clip V (1×t×H×W×3)
│
├─ temporal downsample ─→ X ∈ ℝ^{T×H×W×3}, T=16, stride τ
│ (τ=4 for K400, τ=2 for SSV2)
│
├─ cube embedding (patch=2×16×16, linear proj to D=768)
│ ─→ tokens ∈ ℝ^{(T/2)×(H/16)×(W/16) × D}
│
├─ tube masking: m_{x,y} ~ Bernoulli(ρ), ρ=0.90, shared across t
│ ─→ keep only (1−ρ)=10% of tokens
│
├─ Encoder Φ_enc: 12-block vanilla ViT-B, joint space-time MHA
│ ─→ latent z ∈ ℝ^{N_keep×D}
│
├─ concat with learnable mask tokens
│
├─ Decoder Φ_dec: 4-block ViT, dim=384 (= D/2)
│ ─→ predicted cube pixels Ŷ ∈ ℝ^{T×H×W×3}
│
└─ MSE loss: (1/Ω) · Σ ‖X(p) − Ŷ(p)‖² , only over masked tokens
3.2 Tube masking 的数学形式
Tube masking 的关键在于:把 mask 的随机性限制在 2D 空间 (x, y) 上,然后沿 t 复制。三维索引 \((t, x, y)\) 的 mask 决策可表示为:
换言之,mask 图(mask map)是一个仅在 (x, y) 平面上的二值图,对所有 t 共享。被 mask 的位置形成一个沿时间轴穿透的「管子(tube)」,空心管子里所有 t 帧的同一个 (x, y) 都被一起掩码。
为什么 tube masking 比 random masking 更难走捷径?
在 random masking 下,模型可能做这样的「填空」:frame 0 的 (x1, y1) 被 mask,但 frame 1 的 (x1, y1) 仍是 visible ⇒ 模型可以从 (x1, y1, frame 1) 拷贝像素直接填空,反正它俩在背景区域几乎完全一致。
在 tube masking 下,frame 0、1、2、... 都同时 mask 同一 (x, y) 位置,模型 必须在不同的 (x', y') 坐标或不同语义区域的 tokens 上寻找上下文,这就强迫它学到跨时间的语义推理,而不是低层像素拷贝。
3.3 90% 极高掩码率的合理性
视频的信息密度远低于单张图像(同样像素数下,图像承载的语义结构更多),这意味着即使遮掉 90% 的 cube,剩余 10% 的 tokens 仍可能携带足以恢复关键时空结构的线索。
3.4 Joint Space-Time Attention vs Divided Attention
VideoMAE 选择 joint space-time attention(所有 tokens 在同一个 multi-head self-attention 里互相 attend),与 ViViT 一致。理论上 divided attention(先 spatial 后 temporal)更省 FLOPs,但 VideoMAE 的 90% 掩码率使得 encoder 实际处理的 token 数仅 10% —— 这时 divided attention 的相对收益下降,而 joint attention 让剩余 tokens 之间充分交互,能更高效地利用宝贵的可见信息。
3.5 Decoder 设计:4 blocks 的反直觉选择
ImageMAE 用 1-block decoder 就足够,但 VideoMAE 在 Tab. 11 的 ablation 发现 4-block decoder 是精度-显存的最优平衡:
| Decoder blocks | SSV2 | K400 | GPU mem (1 GPU, bs=16) |
|---|---|---|---|
| 1 | 68.5 | 79.0 | 7.9G |
| 2 | 69.2 | 79.2 | 10.2G |
| 4(默认) | 69.6 | 80.0 | 14.7G |
| 8 | 69.3 | 79.7 | 23.7G |
视频任务需要比图像更深的 decoder 来恢复高维时空结构,但 8 blocks 已陷入边际效益递减。作者最终采用 4 blocks,宽度为 encoder 的一半(ViT-B:encoder 768-d,decoder 384-d)。
4.1 预训练配置(论文 Tab. 13)
| 配置 | SSV2 | K400 |
|---|---|---|
| Optimizer | AdamW | |
| Base learning rate | 1.5e-4(按 batch=256 的 linear scaling) | |
| Weight decay | 0.05 | |
| β₁, β₂ | 0.9, 0.95 | |
| Batch size | 1024 | |
| LR schedule | cosine decay | |
| Warmup epochs | 40 | |
| Flip augmentation | no | yes |
| Aug | MultiScaleCrop | |
| Masking ratio ρ | 90%(UCF/HMDB 用 75%) | |
| Pre-train epochs | 800(主 ablation)/ 2400(主 SOTA) | 800 |
| Hardware | 64 V100 GPUs | 64 V100 GPUs |
为什么 SSV2 关闭 flip augmentation?
SSV2 是 motion-centric 数据集,类标签对方向敏感(如 「Push something from left to right」 与 「right to left」 是两个不同类)。如果使用 random horizontal flip,等价于数据增强把标签语义破坏掉,模型无法学到正确动作。论文作者对此专门在 SSV2 关闭 flip,K400 则保留。
4.2 微调配置(Tab. 14)
| 配置 | SSV2 | K400 |
|---|---|---|
| Optimizer | AdamW | |
| Base LR | 1e-3 (ViT-S), 5e-4 (B, L) | 1e-3 |
| Training epochs | 40 (S, B), 30 (L) | 150 (S), 75 (B), 50 (L, H) |
| Warmup epochs | 5 | |
| Repeated augmentation | 2 | |
| Mixup / Cutmix | 0.8 / 1.0 | |
| Label smoothing | 0.1 | |
| Drop path | 0.1 (S, B), 0.2 (L, H) | |
| Layer-wise LR decay | 0.7 (S), 0.75 (B, L, H) | |
| Sampling | uniform (TSN 风格) | dense (SlowFast 风格) |
| Inference views | 2 clips × 3 crops | 5 clips × 3 crops |
Layer-wise LR decay(LLRD,0.7-0.75)是 ViT fine-tune 的关键技巧 —— 让浅层学习率小、深层学习率大,稳定 fine-tune 收敛。这一设计在 BEiT 中首次系统化,VideoMAE 直接借鉴。
4.3 小数据集(UCF101 / HMDB51)的特殊配方
对极小的数据集,作者 主动调高预训练 epoch、降低 masking ratio,让小数据上的训练更稳定:
| 数据集 | 训练样本数 | 预训练 masking ratio | 预训练 epochs | batch | base LR | 微调 epoch |
|---|---|---|---|---|---|---|
| UCF101 | 9.5k | 75% | 3200 | 192 | 3e-4 | 100, bs=128 |
| HMDB51 | 3.5k | 75% | 4800 | 192 | 3e-4 | 50, bs=128 |
注:K400/SSV2 主表用 90%,但 UCF/HMDB 因为只有数千视频、训不下去那么激进的掩码率。这是工程上很务实的调整 —— 「不要把大模型的设计在小数据上硬搬」。
5.1 推理协议
VideoMAE 的 inference 流程与传统 video Transformer 完全一致 —— 部署时只保留 encoder,decoder 被丢弃,encoder 输出后接一个 linear classifier。具体而言:
- SSV2:uniform sampling(按 TSN),2 clips × 3 crops = 6 views。
- K400:dense sampling(按 SlowFast),5 clips × 3 crops = 15 views。
- UCF101:5 clips × 3 crops。
- HMDB51:10 clips × 3 crops(数据集较小需要更多视角平均)。
5.2 Linear Probing:自监督特征的独立验证
SSV2 上 linear probing 设置(Tab. 15):
| 方法 | Pre-train epochs | Fine-tune acc. | Linear probing acc. |
|---|---|---|---|
| MoCo v3 | 300 | 54.2 | 33.7 |
| VideoMAE | 800 | 69.6 | 38.9 |
linear probing(冻结 encoder,只训练最后一层 linear classifier)是衡量自监督表征质量的「硬指标」。VideoMAE 的 38.9 > MoCo v3 的 33.7 说明它学到的特征质量更高。但更值得注意的是 fine-tune 与 linear 的差距(30.7 vs 5.2 个百分点),意味着 VideoMAE 表征与下游任务需要更精细地调谐才能发挥。
5.3 跨数据集迁移(Tab. 5 transferability)
| 方法 | K400→SSV2 | K400→UCF | K400→HMDB |
|---|---|---|---|
| MoCo v3 | 62.4 | 93.2 | 67.9 |
| VideoMAE | 68.5 | 96.1 | 73.3 |
K400 预训练后迁移到 UCF/HMDB 时,VideoMAE 的精度甚至超过在 UCF/HMDB 自身预训练的版本(K400→UCF 96.1 vs UCF-self 91.3;K400→HMDB 73.3 vs HMDB-self 62.6)。但同样的迁移到 SSV2 时却反过来(68.5 < 69.6)。这个看似矛盾的结果正是 domain shift 论断的来源 —— 当源域与目标域的语义结构高度不同时(如 SSV2 看手势 vs K400 看场景),同域预训练更有效;当语义相近时(K400 与 UCF/HMDB 都是场景级动作分类),大规模跨域预训练是更好的特征起点。
6.1 最高优先级发现:90% 掩码率真有效(Fig. 4)
反直觉的是 90% 不是局部最优,而是「很尖锐」的最优点 —— 即使在 88% 之上进入 95%,精度也只是缓慢下降而非崩塌。这跟 MAE 在图像上 75% 是锐利拐点、低于 60% 就开始掉点的形态完全不同。
6.2 第二优先级发现:Tube > Random > Frame(Tab. 2 mask_types)
| 策略 | 掩码率 | SSV2 | K400 |
|---|---|---|---|
| tube | 75% | 68.0 | 79.8 |
| tube(默认) | 90% | 69.6 | 80.0 |
| random | 90% | 68.3 | 79.5 |
| frame | 87.5%(mask 14/16 帧) | 61.5 | 76.5 |
注意最后一行:frame masking 即使掩码率高达 87.5%(远高于 tube 的 90%),但在 SSV2 上仍然掉 8.1 个百分点(69.6 → 61.5)。这直接证明 frame masking 让模型走捷径完全成立 —— 它甚至不是「重建难」问题,而是「encoder 学到的特征没有用」。Tube masking 比 random masking 在 SSV2 上高 1.3 个百分点,差距虽小但稳定。
6.3 第三优先级发现:3.5k 视频即可训练(Tab. 4)
| 训练数据规模 | 数据集 | from scratch | MoCo v3 | VideoMAE |
|---|---|---|---|---|
| 240k | K400 | 68.8 | 74.2 | 80.0 |
| 169k | SSV2 | 32.6 | 54.2 | 69.6 |
| 9.5k | UCF101 | 51.4 | 81.7 | 91.3 |
| 3.5k | HMDB51 | 18.0 | 39.2 | 62.6 |
6.4 第四优先级发现:训练效率(Tab. 3)
| 方法 | epochs | ft acc | lin acc | hours (64 V100) | speedup |
|---|---|---|---|---|---|
| MoCo v3 | 300 | 54.2 | 33.7 | 61.7 | — |
| VideoMAE | 800 | 69.6 | 38.9 | 19.5 | 3.2× |
VideoMAE 需要更多 epoch(800 vs 300)但 总时长反而更短 —— 因为 90% 掩码率让 encoder 只处理 10% tokens,decoder 又极轻量(4 blocks, 384-d)。这对工业界是大好消息:自监督预训练不需要 1024 块 GPU,64 块 V100 跑 19.5 小时即可。
6.5 主表 SOTA:与同期工作横评(Tab. 5-7)
SSV2(不使用额外数据),VideoMAE ViT-L 16×4 = 74.3%,ViT-L 32 帧 = 75.4%,均为同期无外部数据 SOTA。同期对照:
| 方法 | Backbone | Extra data | Ex. labels | Top-1 |
|---|---|---|---|---|
| BEVT | Swin-B | IN-1K+K400+DALLE | ✗ | 70.6 |
| MaskFeat↑312 | MViT-L | K600 | ✓ | 75.0 |
| VIMPAC | ViT-L | HowTo100M+DALLE | ✗ | 68.1 |
| VideoMAE(无外部数据) | ViT-L | none | ✗ | 74.3 |
| VideoMAE(32 帧) | ViT-L | none | ✗ | 75.4 |
K400(不使用额外数据),VideoMAE ViT-L 16×4 = 85.2%,已经超过依赖 IN-21K 的 TimeSformer/ViViT/Motionformer/Video Swin:
| 方法 | Backbone | Extra data | Top-1 | |
|---|---|---|---|---|
| TimeSformer | ViT-L | IN-21K | 80.7 | |
| ViViT FE | ViT-L | IN-21K | 81.7 | |
| Video Swin | Swin-L | IN-21K | 83.1 | |
| ViViT FE | ViT-L | JFT-300M | 83.5 | |
| MaskFeat | MViT-L | none | 84.3 | |
| VideoMAE | ViT-L | none | 85.2 | |
| VideoMAE(更长 schedule) | ViT-L | none | ✗ | 86.1 |
| VideoMAE | ViT-H | none | ✗ | 86.6 |
| VideoMAE↑320(高分辨) | ViT-H | none | ✗ | 87.4 |
87.4% 是 abstract 中宣称的最高 K400 top-1,对应 ViT-H + 320×320 高分辨率 fine-tune + 32 帧 输入。即使如此,ViT-B/L 的主表数字 81.5 / 85.2 / 86.1 已经是同期不用任何额外数据的最强 baseline,而 ViT-H 的 87.4 进一步证明了「纯像素重建」的可扩展性。
6.6 重建可视化:90% 掩码率下仍可重建(Fig. 7)
重建可视化是论文叙事中最具说服力的一组证据。即使在 90% cube 缺失的情况下,重建出的视频仍保留人物外形、运动方向与场景几何,说明 encoder 真正学到了「时空的语义骨架」而非低层次纹理。
6.7 AVA 动作检测(Tab. 4):泛化到 detection
把 K400 预训练权重转到 AVA v2.2(动作检测而非分类),ViT-B + 无额外 fine-tune 即可达到 26.7 mAP,再 fine-tune K400 标签后 transfer 可达 31.8 mAP;ViT-H 冲到 39.5 mAP,逼近同期 MaskFeat MViT-L + K600 fine-tune 的 38.8。这一结果验证了 VideoMAE 学到的表征在 分类以外的时空定位任务 同样有效。
7.1 三个理论贡献
- 像素重建的范式力量。在 NLP(BERT)和 image(MAE)上都被验证过的 masked autoencoding,在视频上同样奏效 ——「重建」是一个跨模态的通用预训练信号。
- 时间结构可以通过纯自监督学到。Tube masking 不借助光流、frame difference 等手工特征,就能让 vanilla ViT 学到跨时间的语义推理,意味着自监督对时间结构是可探索的。
- 数据质量权重 > 数据数量。源-目标 domain shift 的发现提示我们:在 SSVP 中,相比盲目扩大数据集,优先选择与下游任务同分布的数据可能更划算。
7.2 与 BEVT / VIMPAC / MaskFeat 的关键区别
| 方法 | 骨干 | 预训练目标 | 是否需要额外 tokenizer | 是否需额外数据 |
|---|---|---|---|---|
| VideoMAE | pure ViT | pixel MSE | 否 | 否 |
| BEVT | Swin Transformer | 预测 DALL-E token + 重建像素 | 是(DALL-E) | 是(IN-1K+K400) |
| VIMPAC | ViT-L | 预测 DALL-E token | 是(DALL-E) | 是(HowTo100M) |
| MaskFeat | MViT-L | 重建 HOG 特征 | — | 可选 K600 |
VideoMAE 的「最小依赖」属性 —— 纯 ViT 骨干 + pixel MSE + 无额外 tokenizer + 无额外数据 —— 使它在工程上最容易复现,也最容易扩展到下游任务。
7.3 局限与未解决问题
- 极高掩码率并不普适。90% 的「最优」仅在 dense-temporally-redundant 数据集上有效;当动作变化快或场景切换剧烈时,更高掩码率可能反而拖累。
- 重建目标与识别目标的 gap。论文 §6 分析类别增益时发现,对「small motion object」(如小手指动作)VideoMAE 重建变差 —— 因为小目标的所有 cubes 都被 mask 后,encoder 缺乏线索。这指向 重建 ≠ 识别 的潜在偏差。
- decoder depth 还需要更多研究。视频 MAE 与图像 MAE 在 decoder 深度上的差异(4 vs 1)目前没有理论解释,是经验观察。
7.4 后续工作的关键血缘
- VideoMAE V2 (NeurIPS 2023, Li/Wang et al.):同一作者群的直接扩展,加入 dual masking 与亿级参数,Kinetics 达到 92.6%。
- UMT (CVPR 2023):在 VideoMAE 框架上叠加多模态(image+video+text)联合训练。
- InternVideo / InternVideo2/3 (NeurIPS 2024):视频基础模型系列,把 VideoMAE 作为视觉编码器预训练阶段之一。
- VideoPrism / VideoPoet / VideoLLaMA:Google、Meta 等的 video LLM 多采用 masked video token 作为底层视觉预训练目标。
- MVD, SVFormer, Video-CCAM 等:在 VideoMAE 之上的半监督、压缩域扩展。
7.5 复现路线图(针对读者画像)
把 VideoMAE 当作一个「材料 + 配方」组合来看,复现的难度梯度是:
- 新手友好:用 官方 MCG-NJU 仓库,在 8×V100 上 3200 epoch 训 UCF101 即可拿到 91%+;这本身就是检验框架正确性的最小实验。
- 进阶:复现 SSV2 上的主表(70.8%)。需要 64×V100、800 epoch、90% 掩码率、tube masking、ViT-B;如果验证后精度低 1-2 个点,多半是 LR schedule 或 layer-wise lr decay 漏配。
- 研究级:换 tube masking 为 stochastic depth 可变宽度版本 / 探索 masked visual token 重建(BEiT 风格)/ 替换重建目标为 HOG(MaskFeat 风格)等。这些改动的 ablation 精度一般落在 0.3–0.8 个百分点之间,是稳定的实验场。
工程复现 tips
几个容易踩的坑:(1) β₂=0.95 而不是通常的 0.999 —— MAE 配方;(2) SSV2 必须关 flip;(3) cube embedding 初始化最好从 ImageMAE 的 patch embedding 沿 t 轴 average-pool;(4) DeepSpeed ZeRO-1 对 64 GPU 是必要的,否则 activation memory 把单卡打爆。
VideoMAE 一页纸总结
- 核心机制:tube masking(沿时间共享 mask map)+ 90% 极高掩码率 + vanilla ViT + pixel MSE。
- 几何直觉:masked cube 在所有 t 帧同一 (x, y) 位置上同时消失,强迫跨时间语义推理而非邻帧拷贝。
- 数据效率:在 3.5k 视频的 HMDB51 上比 from-scratch 高 +44.6,比 MoCo v3 高 +23.4。
- 训练效率:比 MoCo v3 快 3.2×(19.5h vs 61.7h on 64 V100)。
- 最强结果:K400 ViT-L 85.2%(no external data)、SSV2 ViT-L 75.4%、AVA ViT-H 39.5 mAP。
- Decoder 配方:4 blocks, dim=384(= encoder dim / 2),显存 14.7G / batch 16 / GPU。
- 反直觉:数据质量 > 数据数量(domain shift 决定一切);90% 掩码率在视频上竟是锐利最优。
参考来源
- Tong, Z., Song, Y., Wang, J., & Wang, L. (2022). VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training. NeurIPS 2022. arXiv:2203.12602.
- He, K., Chen, X., Xie, S., Li, Y., Dollár, P., & Girshick, R. (2021). Masked Autoencoders Are Scalable Vision Learners. arXiv preprint. arXiv:2111.06377.
- Dosovitskiy, A. et al. (2020). An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale. ICLR 2021. arXiv:2010.11929.
- Arnab, A. et al. (2021). ViViT: A Video Vision Transformer. ICCV 2021. arXiv:2103.15691.
- Bertasius, G., Wang, H., & Torresani, L. (2021). Is Space-Time Attention All You Need for Video Understanding? ICML 2021. arXiv:2102.05095.
- Fan, H. et al. (2021). Multiscale Vision Transformers. ICCV 2021. arXiv:2104.11227.
- Wei, C., Fan, H., Xie, S., Wu, C.-Y., Yuille, A., & Feichtenhofer, C. (2021). Masked Feature Prediction for Self-Supervised Visual Pre-Training. arXiv preprint. arXiv:2112.09175.
- Wang, R. et al. (2022). BEVT: Bootstrapping Vision-Language Pre-training with Masked Image and Video Modeling. NeurIPS 2022. arXiv:2201.09907.
- Tan, H. et al. (2021). VIMPAC: Video Pre-Training via Masked Token Prediction and Contrastive Learning. NeurIPS 2022. arXiv:2106.08264.
- Bao, H., Dong, L., Piao, S., & Wei, F. (2021). BEiT: BERT Pre-Training of Image Transformers. ICLR 2022. arXiv:2106.08254.
- Devlin, J., Chang, M.-W., Lee, K., & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL 2019. arXiv:1810.04805.
- Goroshin, R., Bruna, J., Tomioka, R., & LeCun, Y. (2015). Unsupervised Learning of Spatiotemporally Coherent Metrics. ICCV 2015. arXiv:1504.01151.
- Carreira, J. & Zisserman, A. (2017). Quo Vadis, Action Recognition? A New Model and the Kinetics Dataset. CVPR 2017. arXiv:1705.07750.
- Goyal, R. et al. (2017). The "Something Something" Video Database for Learning and Evaluating Compositional Actions. IEEE TPAMI.
- Soomro, K., Zamir, A. R., & Shah, M. (2012). UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild. arXiv preprint. arXiv:1212.0402.
- Kuehne, H. et al. (2011). HMDB: A Large Video Database for Human Motion Recognition. ICCV 2011.
- Gu, C. et al. (2018). AVA: A Video Dataset of Spatio-temporally Localized Atomic Visual Actions. CVPR 2018.
- MCG-NJU. (2022). VideoMAE official PyTorch implementation. github.com/MCG-NJU/VideoMAE.
- Li, K., Wang, Y., He, Y., Li, Y., Wang, Y., Wang, L., & Qiao, Y. (2023). VideoMAE V2: Gaining a Better Video Vision Transformer with Dense Tokenized Masked Autoencoders. NeurIPS 2023. arXiv:2211.09910.