视频基础模型时代的动作检测
在上一篇综述中我们看到,动物动作识别的核心瓶颈在于 CG→FG 的精度鸿沟。但如果把视角从"特定领域"拉升到"通用视频理解",一个更深层的范式转型正在发生:视频基础模型(Video Foundation Model)正在把动作检测从"训练一个小检测器"变成"提取通用表征后做轻量探测"。
这个转变的标志性数字是:InternVideo2(6B 参数)在 THUMOS14 时序动作检测上达到 72.0 mAP #Wang et al., 2024,而 OpenTAD 框架证明仅替换 backbone 为 InternVideo2 就能在 THUMOS14 上提升 +3.92% #Liu et al., 2025。更激进的是 FreeZAD——完全无需训练,仅用冻结的 CoCa 视觉-语言模型就能在 THUMOS14 上达到 10.0% mAP,推理速度 128.9 FPS #Han et al., 2025。
这些数字背后的逻辑链条很清晰:
- 自监督预训练学到了通用的视频表征(VideoMAE → InternVideo2 → V-JEPA 2)
- 表征质量直接决定了下游 TAD 的上限(OpenTAD 的 backbone 消融实验是最好的证据)
- 视觉-语言对齐让零样本/开放词汇动作检测成为可能(FreeZAD、VideoLLaMA 3)
本文作为动作识别系列的第六篇,聚焦一个核心问题:视频基础模型时代,动作检测的技术格局发生了什么变化? 我们深读了 8 篇 2022-2026 年的核心论文,覆盖三条预训练范式(掩码重建 / 表示预测 / SSM)、两个下游任务(动作识别 / 时序动作检测)和两种泛化模式(零样本 / VLM)。
视频基础模型的技术演进可以归纳为三条路线,每条路线解决的核心问题不同:
flowchart LR
subgraph MAE["掩码重建路线"]
direction TB
A1["VideoMAE V1
NeurIPS 2022"]
A2["VideoMAE V2
CVPR 2023"]
A3["InternVideo2
ECCV 2024"]
A4["RVM
DeepMind 2025"]
A1 --> A2 --> A3 --> A4
end
subgraph JEPA["表示预测路线"]
direction TB
B1["V-JEPA v1
Meta 2024"]
B2["V-JEPA 2
Meta 2025"]
B1 --> B2
end
subgraph SSM["SSM/Mamba 路线"]
direction TB
C1["VideoMamba
ECCV 2024"]
C2["UniFormerV2
ICLR 2024"]
end
MAE --> |"超越像素重建"| JEPA
MAE --> |"替代 Transformer"| SSM
六大模型核心指标对比
| 模型 | 范式 | 参数量 | K400 Top-1 | SSv2 Top-1 | 预训练数据 | 会议 |
|---|---|---|---|---|---|---|
| VideoMAEv2-g | pixel MAE | 1B | 90.0% | 77.0% | K710 (660K) | CVPR 2023 |
| InternVideo2-6B | 双教师蒸馏 | 6B | 92.1% | 77.5% | 402M 条目 | ECCV 2024 |
| V-JEPA 2 ViT-g | JEPA | 1B | 87.3% | 77.3% | VM22M (22M clips) | 2025 |
| VideoMamba-M | SSM | 74M | 85.0% | 71.4% | CLIP-400M | ECCV 2024 |
| UniFormerV2-L/14 | 图像迁移 | 354M | 90.0% | 73.0% | CLIP-400M + K710 | ICLR 2024 |
| RVM-S | 循环 MAE | 34M | 49.6% | 59.7% | 8.4M clips | CVPR 2026 |
这张表揭示了一个关键现象:不同范式在不同维度上各有所长。InternVideo2 在 K400(场景相关)上最强,V-JEPA 2 在 SSv2(细粒度运动)上与 InternVideo2 持平但仅用 1/6 参数,VideoMamba 以 74M 参数达到 85.0% K400,RVM-S 仅 34M 参数却在 8 个下游任务的归一化平均中超越 1B 级巨型模型。
K400 准确率 ≠ TAD 性能
OpenTAD 的 backbone 消融实验发现:VideoSwin-S(K400 80.5%)和 MViTv2-L(K400 85.4%)在 TAD 上反而不如 SlowFast-R101(K400 78.7%)。动作分类精度与时序定位能力并非线性正相关,ViT 系 backbone 整体上更适合 TAD 任务 #Liu et al., 2025。
3.1 像素重建:从 VideoMAE 到 InternVideo2 的双教师蒸馏
VideoMAE #Liu et al., 2022 开创了视频掩码自编码器的先河:随机遮挡 90% 的时空 token,让模型重建被遮挡的像素。VideoMAE V2 #Wang et al., 2023 进一步引入双重掩码策略(encoder 和 decoder 使用不同的 masking ratio),在 K400 上达到 90.0%。
InternVideo2(前作 InternVideo #Wang et al., 2022 融合生成式与判别式学习)在此基础上做了一个关键改进——不重建被 mask 的 token,而是重建未被 mask 的 token:
其中 $f^V$ 是学生编码器,$h$ 是 InternVL-6B(多模态教师),$g$ 是 VideoMAEv2-g(运动感知教师),$p \in \mathcal{U}$ 表示仅遍历未被 mask 的 token 集合。Masking 在此不是学习目标,而是数据增强和计算效率手段——80% 的 token 被丢弃,剩余 20% 的可见 token 同时逼近两个互补教师的表征空间 #Wang et al., 2024。
这种双教师设计的动机很直觉:InternVL-6B 提供语义丰富的表征(使编码器多模态友好),VideoMAEv2-g 提供运动敏感的表征(增强时序建模)。消融实验显示双教师比单教师(仅 UMT 或仅 VideoPrism)在 SSv2 上提升 0.4-0.6 个点。
3.2 表示空间预测:V-JEPA 2 的 JEPA 范式
V-JEPA 2(前作 V-JEPA v1 #Bardes et al., 2024 首次将 JEPA 引入视频域)选择了完全不同的路线:不在像素空间做重建,而是在学到的表示空间中做预测 #Bardes et al., 2025。
其中 $E_\theta$ 是 Encoder(ViT-L/H/g,最大 1B),$E_{\bar\theta}$ 是 EMA-Teacher,$P_\phi$ 是轻量 Predictor(ViT-s,22M),$\Delta_y$ 是可学习的 mask token。损失仅在被遮挡 patch 的预测上计算。
JEPA 的核心优势在于自动过滤不可预测信息——模型不需要恢复草叶的精确位置或光照的细微变化,只需预测场景的语义和动态结构。这直接反映在 SSv2(细粒度运动理解)上的巨大领先:
| 模型 | 参数量 | SSv2 Top-1 | 预训练方式 |
|---|---|---|---|
| V-JEPA 2 ViT-g₃₈₄ | 1B | 77.3% | 纯自监督 |
| VideoPrism-g | 1B | 68.5% | 自监督 |
| InternVideo2-6B | 6B | 67.7% | 自监督+有监督 |
| VideoMAEv2-g | 1B | 56.1% | 像素重建 |
V-JEPA 2 在 SSv2 上比 VideoMAEv2 高出 +21.2 points,同时预训练数据规模(VM22M:22M clips / 1M+ 小时)远小于 InternVideo2 的 402M 条目。更令人惊讶的是,V-JEPA 2 的编码器未经语言监督预训练,对齐 LLM 后在视频 QA 上即达到 SOTA(平均 59.5),颠覆了"视频模型需要文本对齐才能做好 QA"的传统认知。
3.3 循环时序建模:RVM 的 30 倍参数效率
DeepMind 的 RVM 提出了第三条路线:用循环神经网络替代时空自注意力 #Recasens et al., 2025。其 Transformer-GRU 循环核心的数学表达为:
RVM 的训练采用非对称掩码:源帧不遮挡,目标帧 95% 遮挡,模型从源帧的循环状态重建目标帧像素。这种设计显式建模了时间的因果性。
RVM 最惊人的发现是参数效率:34M 参数的 RVM-S 在 8 个下游任务的归一化平均中超越 1B 级模型(96.1 vs VideoMAEv2-g 的 77.9)。原因是循环架构的参数共享(ViT 编码器跨帧共享权重)和强归纳偏置(因果时序建模)。同时,仅用 4 帧训练的模型可稳定传播特征到 80+ 帧——这对长视频 TAD 极为关键。
3.4 SSM 路线:VideoMamba 的线性复杂度
VideoMamba 将 Mamba 状态空间模型适配到视频域 #Zhu et al., 2024。三种扫描策略中,Spatial-First(逐帧扫描空间 token)最为简洁高效(SSv2 65.1%),可无缝复用 2D 预训练知识。在效率上,VideoMamba 处理 64 帧视频时比 TimeSformer 快 6 倍、GPU 显存降低 40 倍,74M 参数在 K400 上达到 85.0%(自监督),且在 Breakfast(97.9%)和 COIN(90.4%)长视频基准上大幅领先。
| 效率指标 | TimeSformer | VideoMamba-M | 提升 |
|---|---|---|---|
| 推理速度(64 帧) | 1× | 6× | 6 倍 |
| GPU 显存(64 帧) | 1× | 1/40 | 40 倍 |
| 参数量 vs ViViT-L | 311M | 74M | 4.2 倍更少 |
4.1 OpenTAD:统一 16 种方法的模块化框架
OpenTAD #Liu et al., 2025 是首个真正统一的 TAD 框架,将 TAD 方法解耦为三阶段 pipeline:Backbone → Neck → Detection Head。通过大规模消融实验(16 种方法 × 9 个数据集),论文发现了几个颠覆性的结论:
- Neck 设计对性能影响最大:Mamba block 在多尺度方法(ActionFormer/TriDet)中最优,Transformer block 在单尺度方法(BMN/GTAD)中最优
- 混合 Neck 是全局最优:Mamba + Transformer block mix(SSM + LSTM)在所有方法上均取得最佳结果
- Stage 2 refinement 始终有益:one-stage 方法添加 Stage 2 后 ANet +0.29%,THU +0.68%
- InternVideo2 backbone 碾压一切:替换 TSP → InternVideo2 后 ActionFormer ANet 从 37.07% 跃升至 38.95%(+1.88%),THU 从 68.44% 跃升至 72.36%(+3.92%)
最终最优组合(InternVideo2-6B + block mix neck + Stage 2)在 ActivityNet 达到 39.51% Avg mAP,THUMOS-14 达到 73.42% Avg mAP。
4.2 Backbone 消融:K400 准确率不等于 TAD 性能
OpenTAD 最重要的发现之一是动作分类精度与时序定位能力的脱节:
| Backbone | K400 Top-1 | ANet mAP | THU mAP |
|---|---|---|---|
| SlowFast-R101 | 78.7% | 36.83% | 67.33% |
| VideoSwin-S | 80.5% | 35.27% | 64.42% |
| MViTv2-L | 85.4% | 35.86% | 65.17% |
| InternVideo2-6B | 92.1% | 38.95% | 72.36% |
VideoSwin-S 和 MViTv2-L 在 K400 上优于 SlowFast-R101,但在 TAD 上反而更差。这说明 CNN 系 backbone 学到的特征在时序定位上存在不匹配,ViT 系(尤其是经过自监督预训练的 VFM)才是 TAD 的最佳 backbone 选择。
4.3 FreeZAD:完全无需训练的零样本 TAD
FreeZAD #Han et al., 2025 走了一条完全不同的路线——完全不训练任何参数,直接利用预训练 CoCa(ViT-L/14)的冻结特征做时序动作检测。
方法分三步:(1) 用 CoCa 视觉编码器逐帧提取 RGB 特征,文本编码器将候选类别映射为原型;(2) 原型引导逐帧相似度计算,经平滑和阈值化生成候选片段;(3) 设计 LogOIC(对数衰减加权 Outer-Inner-Contrastive 分数)增强边界敏感性,并通过基于 FFT 的 Actionness Calibration 利用频率能量修正置信度。
| 方法 | 类型 | THU mAP | ANet mAP | FPS | 显存 |
|---|---|---|---|---|---|
| DeTAL | 全监督 | 25.3% | 25.8% | — | — |
| T3AL | 无监督 | 9.2% | 15.4% | 10.1 | 8.6 GB |
| FreeZAD | 无训练 | 10.0% | 18.3% | 128.9 | 3.3 GB |
| AdaZAD | TTA | 14.0% | 19.3% | 28.4 | 3.7 GB |
FreeZAD 的推理速度是 T3AL 的 12.8 倍,显存仅为 38%。AdaZAD 通过轻量测试时适配(仅 1.2M 参数)将 mAP 从 10.0% 提升至 14.0%(+40%),在 ActivityNet 上甚至超过有监督方法 Eff-Prompt(23.1% → 19.3%,差距仅 3.8%)。但 THUMOS14 上零样本(10.0%)与全监督(DeTAL 25.3%)仍有 15% 的绝对差距,Oracle 分析指出完美标签可提升 1.3%,完美采样提升 3.6%——伪标签质量是主要瓶颈。
4.4 端到端 TAD 的兴起
OpenTAD 还揭示了一条新兴路线:端到端训练。AdaTAD 使用 VideoMAEv2-G backbone + adapter tuning 在 THUMOS14 上达到 77.07% Avg mAP,远超所有特征提取方法(最高 73.42%)。这暗示了未来 TAD 的最优范式可能不是"先预训练 VFM,再提取特征",而是"VFM 做 backbone,端到端微调"。
端到端 vs 两阶段的权衡
端到端训练消除了离线特征提取的信息损失,但需要 GPU 常驻大模型(VideoMAEv2-G 约 1B 参数)。两阶段方法可以离线提取特征后反复实验检测头设计,更适合研究迭代。OpenTAD 的代码库同时支持两种范式。
5.1 VideoLLaMA 3:vision-centric 范式
VideoLLaMA 3 #Wang et al., 2025 代表了一种激进的设计哲学:高质量图像理解是视频理解的基础。与准备海量视频-文本数据集不同,VideoLLaMA 3 聚焦于构建大规模高质量图文数据集(>60M),视频数据仅约 6M。
训练分为 4 个阶段:(1) Vision Encoder Adaptation——用 2D-RoPE 替换 SigLIP 的绝对位置编码,支持任意分辨率输入;(2) Vision-Language Alignment——27.2M 图文数据全参数对齐;(3) Multi-task Fine-tuning——引入 2.92M 通用视频数据和 DiffFP 视频压缩器;(4) Video-centric Fine-tuning——增强时间定位能力。
结果:2B 模型在 13 项视频基准中 12 项最优,7B 模型全部 8 项最优。ActivityNet-QA(动作理解)达到 61.3,PerceptionTest(动作感知)达到 72.8,Charades-STA(时间定位)达到 60.7。
5.2 VLM 的时间定位能力
| 能力维度 | VideoLLaMA3 7B | V-JEPA 2 | InternVideo2 |
|---|---|---|---|
| 动作理解(ActivityNet-QA) | 61.3 | — | — |
| 动作感知(PerceptionTest) | 72.8 | — | — |
| 时间定位(Charades-STA) | 60.7 | — | — |
| 运动理解(SSv2 Top-1) | — | 77.3 | 77.5 |
| 视频 QA 平均 | SOTA | 59.5 | — |
这揭示了一个有趣的互补性:V-JEPA 2 擅长运动表征和预测,VideoLLaMA 3 擅长语言理解和多模态推理。两者结合(V-JEPA 2 编码器作为 VLM 的视觉 backbone)可能产生更强的 TAD 系统。
5.3 UniFormerV2:图像预训练迁移的极致
UniFormerV2 #Li et al., 2022 证明了一个反直觉的结论:不需要视频预训练,仅用 CLIP-400M 图像预训练的 ViT 加上轻量时序模块,5 epoch 微调即可在 K400 上达到 90.0%——首次突破 90% 大关。
其 Local UniBlock 在 ViT 块前插入局部时序 MHRA(参数仅 $t \times 1 \times 1$),Global UniBlock 用交叉注意力将复杂度从 $O(L^2)$ 降至 $O(L)$。B/16 模型仅 3.6T FLOPs(Swin-L 的 1/29),达到 83.4% K400。
这意味着对于资源有限的实际场景(如系列四讨论的边缘部署),UniFormerV2 的"图像预训练 + 极少微调"范式可能是最实用的 VFM 迁移方案。
6.1 动作识别性能总表
| 模型 | K400 | SSv2 | UCF101 | HMDB51 | MiT | ANet |
|---|---|---|---|---|---|---|
| InternVideo2-6B | 92.1 | 77.5 | 97.3 | 80.7 | 51.2 | 95.9 |
| V-JEPA 2 ViT-g | 87.3 | 77.3 | — | — | — | — |
| UniFormerV2-L/14 | 90.0 | 73.0 | — | — | — | — |
| VideoMamba-M | 85.0 | 71.4 | — | — | — | — |
| RVM-H | 60.0 | 68.7 | — | — | — | — |
| VideoMAEv2-g | 90.0 | 77.0 | — | — | — | — |
6.2 TAD 性能总表
| 方法 | Backbone | THUMOS14 mAP | ActivityNet mAP | 类型 |
|---|---|---|---|---|
| OpenTAD (ActionFormer+) | InternVideo2-6B | 73.42% | 39.51% | 全监督 |
| AdaTAD | VideoMAEv2-G | 77.07% | — | 端到端 |
| InternVideo2 直用 | ViT-6B | 72.0% | 41.2% | 特征提取 |
| VideoMambaSuite | InternVideo2-6B | 69.57% | 37.45% | 全监督 |
| AdaZAD | CoCa ViT-L/14 | 14.0% | 19.3% | TTA |
| FreeZAD | CoCa ViT-L/14 | 10.0% | 18.3% | 无训练 |
6.3 预训练成本与效率对比
| 模型 | 预训练硬件 | 训练时长 | 数据规模 | 效率亮点 |
|---|---|---|---|---|
| InternVideo2-6B | 256 A100 | 35 天 | 402M 条目 | 渐进式三阶段训练 |
| V-JEPA 2 ViT-g | — | — | 22M clips | 渐进式分辨率 8.4× 加速 |
| VideoMamba-M | — | — | CLIP-400M | 推理 6× 加速,40× 显存 |
| UniFormerV2-L/14 | — | 5 epoch | CLIP + K710 | 5 epoch 即达 SOTA |
| RVM-S | 256 TPU-v6 | 1M steps | 8.4M clips | 34M 参数,无蒸馏 |
与已有系列文章的关系
| 文章 | 覆盖范围 | 本文的差异视角 |
|---|---|---|
| 系列一·导览 | 7 条技术路线概览 | 深入 VFM 范式的技术细节 |
| 系列二·动物 | 动物动作识别全景 | VFM 跨物种迁移(未来方向) |
| 系列四·选型 | mmaction2 + 边缘部署 | VFM 前沿方法 + 云端训练 |
| 系列五·CG→FG | 粗粒度到细粒度综述 | VFM 作为 CG→FG 的潜在解决方案 |
| VideoMAE 精读 | VideoMAE V1 深度解读 | 覆盖 V2 及后续所有演进 |
六个开放问题
- VFM 特征 vs 端到端训练:AdaTAD(端到端,77.07% THU)远超特征提取方法(73.42%),但需要 1B 参数模型常驻 GPU。最优范式取决于部署约束。
- 长视频 TAD:RVM 的线性推理复杂度和 80+ 帧特征稳定性、VideoMamba 的 6× 加速,是否意味着 SSM/RNN 在长视频 TAD 上碾压 Transformer?ActivityNet 平均 180 秒视频是最佳测试场。
- 零样本精度上限:FreeZAD 与全监督方法有 15% 绝对差距。Oracle 分析指出伪标签质量是瓶颈,但 1.2M 参数的 AdaZAD 就能缩小到 11%——轻量适配是否是零样本 TAD 的最佳出路?
- 多模态 VFM:InternVideo2 的四模态对比学习(视频+音频+语音+文本)表明多模态互利互惠。音频特征对 TAD(尤其是包含语音指令的动作)有多大增益?
- VFM 跨物种迁移:系列五揭示 FG 动物动作识别仅 12.7-29.6% 准确率。VFM 的通用表征能否作为 CG→FG 的 bridge?V-JEPA 2 在运动理解上的强势表现值得关注。
- 边缘部署:系列四讨论了 500 元 BOM 约束。VideoMamba 的 SSM 算子在 TensorRT/NCNN 上仍无原生支持,UniFormerV2-B/16(3.6T FLOPs)和 RVM-S(34M)是当前最可行的候选。
可操作启发
如果要在实际项目中使用视频基础模型做动作检测,当前的最佳实践路径是:
- 云端高精度:InternVideo2-6B backbone + OpenTAD 最优 Neck/Head → ActivityNet 39.51%, THUMOS14 73.42%
- 资源受限:UniFormerV2-B/16 + K710 中间训练 + 5 epoch 微调 → K400 83.4%, 仅 3.6T FLOPs
- 零样本快速部署:FreeZAD(CoCa 冻结)→ 128.9 FPS, 3.3 GB 显存, 无需训练
- 长视频监控:VideoMamba-M 或 RVM → 线性推理复杂度, 特征长期稳定
参考来源
- Wang, Y. et al. (2024). InternVideo2: Scaling Foundation Models for Multimodal Video Understanding. ECCV 2024. arXiv:2403.15377
- Bardes, A. et al. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. Meta FAIR. arXiv:2506.09985
- Zhu, Z. et al. (2024). VideoMamba: State Space Model for Efficient Video Understanding. ECCV 2024. arXiv:2403.06977
- Liu, J. et al. (2025). OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection. arXiv:2502.20361
- Han, C. et al. (2025). FreeZAD: Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models. IEEE TMM 2026. arXiv:2501.13795
- Li, K. et al. (2022). UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer. ICLR 2024. arXiv:2211.09552
- Wang, K. et al. (2025). VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding. arXiv:2501.13106
- Recasens, A. et al. (2025). Recurrent Video Masked Autoencoders. Google DeepMind. CVPR 2026. arXiv:2512.13684
- Wang, Z. et al. (2023). VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking. CVPR 2023. arXiv:2303.16727
- Wang, Y. et al. (2022). InternVideo: General Video Foundation Models via Generative and Discriminative Learning. arXiv:2212.03191
- Liu, Z. et al. (2022). VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training. NeurIPS 2022. arXiv:2203.12602
- Bardes, A. et al. (2024). V-JEPA: Video Joint Embedding Predictive Architecture. Meta FAIR. arXiv:2404.16790