ESC
输入关键词搜索文章
目录

视频基础模型时代的动作检测

InternVideo2 · V-JEPA 2 · VideoMamba · RVM · UniFormerV2
8 篇核心论文深读 · 3 条预训练范式 · 统一 TAD 框架 · 零样本泛化前沿
8深读论文
3预训练范式
92.1%K400 SOTA
77.3SSv2 SOTA
Part 1
为什么视频基础模型正在重塑动作检测

上一篇综述中我们看到,动物动作识别的核心瓶颈在于 CG→FG 的精度鸿沟。但如果把视角从"特定领域"拉升到"通用视频理解",一个更深层的范式转型正在发生:视频基础模型(Video Foundation Model)正在把动作检测从"训练一个小检测器"变成"提取通用表征后做轻量探测"

这个转变的标志性数字是:InternVideo2(6B 参数)在 THUMOS14 时序动作检测上达到 72.0 mAP #Wang et al., 2024,而 OpenTAD 框架证明仅替换 backbone 为 InternVideo2 就能在 THUMOS14 上提升 +3.92% #Liu et al., 2025。更激进的是 FreeZAD——完全无需训练,仅用冻结的 CoCa 视觉-语言模型就能在 THUMOS14 上达到 10.0% mAP,推理速度 128.9 FPS #Han et al., 2025

这些数字背后的逻辑链条很清晰:

  1. 自监督预训练学到了通用的视频表征(VideoMAE → InternVideo2 → V-JEPA 2)
  2. 表征质量直接决定了下游 TAD 的上限(OpenTAD 的 backbone 消融实验是最好的证据)
  3. 视觉-语言对齐让零样本/开放词汇动作检测成为可能(FreeZAD、VideoLLaMA 3)

本文作为动作识别系列的第六篇,聚焦一个核心问题:视频基础模型时代,动作检测的技术格局发生了什么变化? 我们深读了 8 篇 2022-2026 年的核心论文,覆盖三条预训练范式(掩码重建 / 表示预测 / SSM)、两个下游任务(动作识别 / 时序动作检测)和两种泛化模式(零样本 / VLM)。

本文与系列其他文章的关系系列一给出了 7 条技术路线的宏观导览;系列四聚焦 mmaction2 工具链和边缘部署选型;本文则从 VFM 视角深入前沿方法的技术细节。
Part 2
三条技术路线:从掩码重建到表示预测到状态空间模型

视频基础模型的技术演进可以归纳为三条路线,每条路线解决的核心问题不同:

flowchart LR
  subgraph MAE["掩码重建路线"]
    direction TB
    A1["VideoMAE V1
NeurIPS 2022"] A2["VideoMAE V2
CVPR 2023"] A3["InternVideo2
ECCV 2024"] A4["RVM
DeepMind 2025"] A1 --> A2 --> A3 --> A4 end subgraph JEPA["表示预测路线"] direction TB B1["V-JEPA v1
Meta 2024"] B2["V-JEPA 2
Meta 2025"] B1 --> B2 end subgraph SSM["SSM/Mamba 路线"] direction TB C1["VideoMamba
ECCV 2024"] C2["UniFormerV2
ICLR 2024"] end MAE --> |"超越像素重建"| JEPA MAE --> |"替代 Transformer"| SSM

六大模型核心指标对比

模型范式参数量K400 Top-1SSv2 Top-1预训练数据会议
VideoMAEv2-gpixel MAE1B90.0%77.0%K710 (660K)CVPR 2023
InternVideo2-6B双教师蒸馏6B92.1%77.5%402M 条目ECCV 2024
V-JEPA 2 ViT-gJEPA1B87.3%77.3%VM22M (22M clips)2025
VideoMamba-MSSM74M85.0%71.4%CLIP-400MECCV 2024
UniFormerV2-L/14图像迁移354M90.0%73.0%CLIP-400M + K710ICLR 2024
RVM-S循环 MAE34M49.6%59.7%8.4M clipsCVPR 2026

这张表揭示了一个关键现象:不同范式在不同维度上各有所长。InternVideo2 在 K400(场景相关)上最强,V-JEPA 2 在 SSv2(细粒度运动)上与 InternVideo2 持平但仅用 1/6 参数,VideoMamba 以 74M 参数达到 85.0% K400,RVM-S 仅 34M 参数却在 8 个下游任务的归一化平均中超越 1B 级巨型模型。

K400 准确率 ≠ TAD 性能

OpenTAD 的 backbone 消融实验发现:VideoSwin-S(K400 80.5%)和 MViTv2-L(K400 85.4%)在 TAD 上反而不如 SlowFast-R101(K400 78.7%)。动作分类精度与时序定位能力并非线性正相关,ViT 系 backbone 整体上更适合 TAD 任务 #Liu et al., 2025

Part 3
掩码视频建模的三个范式

3.1 像素重建:从 VideoMAE 到 InternVideo2 的双教师蒸馏

VideoMAE #Liu et al., 2022 开创了视频掩码自编码器的先河:随机遮挡 90% 的时空 token,让模型重建被遮挡的像素。VideoMAE V2 #Wang et al., 2023 进一步引入双重掩码策略(encoder 和 decoder 使用不同的 masking ratio),在 K400 上达到 90.0%。

VideoMAE tube masking versus frame and random masking
图 1:VideoMAE 提出的时空掩码策略对比——帧掩码 / 随机掩码 / 管状(tube)掩码。管状掩码沿时间轴对齐遮挡位置,避免信息从相邻帧泄漏,是高遮挡率下自监督的关键设计(来源:VideoMAE, Tong et al., NeurIPS 2022, arXiv:2203.12602)。

InternVideo2(前作 InternVideo #Wang et al., 2022 融合生成式与判别式学习)在此基础上做了一个关键改进——不重建被 mask 的 token,而是重建未被 mask 的 token

$$\mathcal{L}_{\text{Stage1}} = \frac{1}{Z}\sum_{p \in \mathcal{U}}\left(\alpha_1\|f^V(\mathbf{V}_p) - h(\mathbf{V}_p)\|^2 + \alpha_2\|f^V(\mathbf{V}_p) - g(\mathbf{V}_p)\|^2\right)$$

其中 $f^V$ 是学生编码器,$h$ 是 InternVL-6B(多模态教师),$g$ 是 VideoMAEv2-g(运动感知教师),$p \in \mathcal{U}$ 表示仅遍历未被 mask 的 token 集合。Masking 在此不是学习目标,而是数据增强和计算效率手段——80% 的 token 被丢弃,剩余 20% 的可见 token 同时逼近两个互补教师的表征空间 #Wang et al., 2024

这种双教师设计的动机很直觉:InternVL-6B 提供语义丰富的表征(使编码器多模态友好),VideoMAEv2-g 提供运动敏感的表征(增强时序建模)。消融实验显示双教师比单教师(仅 UMT 或仅 VideoPrism)在 SSv2 上提升 0.4-0.6 个点。

3.2 表示空间预测:V-JEPA 2 的 JEPA 范式

V-JEPA 2(前作 V-JEPA v1 #Bardes et al., 2024 首次将 JEPA 引入视频域)选择了完全不同的路线:不在像素空间做重建,而是在学到的表示空间中做预测 #Bardes et al., 2025

V-JEPA 2 pretraining and downstream tasks overview
图 2:V-JEPA 2 的两阶段范式——先用百万小时互联网视频做自监督视频预训练,再分别接语言对齐(视频 QA)、注意力探针(动作分类 / 识别 / 预测)与动作条件后训练(机器人操作规划)(来源:V-JEPA 2, Bardes et al., Meta FAIR 2025, arXiv:2506.09985)。
$$\min_{\theta,\phi,\Delta_y} \quad \| P_\phi(\Delta_y, E_\theta(x)) - \text{sg}(E_{\bar\theta}(y)) \|_1$$

其中 $E_\theta$ 是 Encoder(ViT-L/H/g,最大 1B),$E_{\bar\theta}$ 是 EMA-Teacher,$P_\phi$ 是轻量 Predictor(ViT-s,22M),$\Delta_y$ 是可学习的 mask token。损失仅在被遮挡 patch 的预测上计算。

JEPA 的核心优势在于自动过滤不可预测信息——模型不需要恢复草叶的精确位置或光照的细微变化,只需预测场景的语义和动态结构。这直接反映在 SSv2(细粒度运动理解)上的巨大领先:

模型参数量SSv2 Top-1预训练方式
V-JEPA 2 ViT-g₃₈₄1B77.3%纯自监督
VideoPrism-g1B68.5%自监督
InternVideo2-6B6B67.7%自监督+有监督
VideoMAEv2-g1B56.1%像素重建

V-JEPA 2 在 SSv2 上比 VideoMAEv2 高出 +21.2 points,同时预训练数据规模(VM22M:22M clips / 1M+ 小时)远小于 InternVideo2 的 402M 条目。更令人惊讶的是,V-JEPA 2 的编码器未经语言监督预训练,对齐 LLM 后在视频 QA 上即达到 SOTA(平均 59.5),颠覆了"视频模型需要文本对齐才能做好 QA"的传统认知。

3.3 循环时序建模:RVM 的 30 倍参数效率

DeepMind 的 RVM 提出了第三条路线:用循环神经网络替代时空自注意力 #Recasens et al., 2025。其 Transformer-GRU 循环核心的数学表达为:

$$u_t = \sigma(W^u_e \hat{e}_t + W^u_s s_{t-1}) \quad \text{(update gate)}$$
$$\hat{h}_t = \text{Tx}(q=\hat{e}_t,\; kv=r_t \odot s_{t-1}) \quad \text{(cross+self attention)}$$
$$s_t = (1 - u_t) \odot s_{t-1} + u_t \odot \hat{h}_t \quad \text{(state update)}$$

RVM 的训练采用非对称掩码:源帧不遮挡,目标帧 95% 遮挡,模型从源帧的循环状态重建目标帧像素。这种设计显式建模了时间的因果性。

RVM 最惊人的发现是参数效率:34M 参数的 RVM-S 在 8 个下游任务的归一化平均中超越 1B 级模型(96.1 vs VideoMAEv2-g 的 77.9)。原因是循环架构的参数共享(ViT 编码器跨帧共享权重)和强归纳偏置(因果时序建模)。同时,仅用 4 帧训练的模型可稳定传播特征到 80+ 帧——这对长视频 TAD 极为关键。

3.4 SSM 路线:VideoMamba 的线性复杂度

VideoMamba 将 Mamba 状态空间模型适配到视频域 #Zhu et al., 2024。三种扫描策略中,Spatial-First(逐帧扫描空间 token)最为简洁高效(SSv2 65.1%),可无缝复用 2D 预训练知识。在效率上,VideoMamba 处理 64 帧视频时比 TimeSformer 快 6 倍、GPU 显存降低 40 倍,74M 参数在 K400 上达到 85.0%(自监督),且在 Breakfast(97.9%)和 COIN(90.4%)长视频基准上大幅领先。

Vanilla Mamba block versus bidirectional Mamba block
图 3:原始 Mamba 块(左)与 VideoMamba 采用的双向 Mamba 块(右)。双向扫描让每个 token 同时汇聚正序与逆序的时空上下文,在保持线性复杂度的同时补足单向 SSM 的感受野缺陷(来源:VideoMamba, Li et al., ECCV 2024, arXiv:2403.06977)。
效率指标TimeSformerVideoMamba-M提升
推理速度(64 帧)6 倍
GPU 显存(64 帧)1/4040 倍
参数量 vs ViViT-L311M74M4.2 倍更少
Part 4
时序动作检测的 VFM 革命

4.1 OpenTAD:统一 16 种方法的模块化框架

OpenTAD #Liu et al., 2025 是首个真正统一的 TAD 框架,将 TAD 方法解耦为三阶段 pipeline:Backbone → Neck → Detection Head。通过大规模消融实验(16 种方法 × 9 个数据集),论文发现了几个颠覆性的结论:

OpenTAD unified temporal action detection pipeline
图 4:OpenTAD 的统一时序动作检测流水线。视频经 Backbone(可冻结或微调)→ Neck → Dense head 生成候选提案,再经可选的 Stage 2(RoI 提取 + Proposal head)做精修,覆盖单阶段与两阶段所有主流 TAD 方法(来源:OpenTAD, Liu et al., 2025, arXiv:2502.20361)。
  1. Neck 设计对性能影响最大:Mamba block 在多尺度方法(ActionFormer/TriDet)中最优,Transformer block 在单尺度方法(BMN/GTAD)中最优
  2. 混合 Neck 是全局最优:Mamba + Transformer block mix(SSM + LSTM)在所有方法上均取得最佳结果
  3. Stage 2 refinement 始终有益:one-stage 方法添加 Stage 2 后 ANet +0.29%,THU +0.68%
  4. InternVideo2 backbone 碾压一切:替换 TSP → InternVideo2 后 ActionFormer ANet 从 37.07% 跃升至 38.95%(+1.88%),THU 从 68.44% 跃升至 72.36%(+3.92%)

最终最优组合(InternVideo2-6B + block mix neck + Stage 2)在 ActivityNet 达到 39.51% Avg mAP,THUMOS-14 达到 73.42% Avg mAP。

4.2 Backbone 消融:K400 准确率不等于 TAD 性能

OpenTAD 最重要的发现之一是动作分类精度与时序定位能力的脱节

BackboneK400 Top-1ANet mAPTHU mAP
SlowFast-R10178.7%36.83%67.33%
VideoSwin-S80.5%35.27%64.42%
MViTv2-L85.4%35.86%65.17%
InternVideo2-6B92.1%38.95%72.36%

VideoSwin-S 和 MViTv2-L 在 K400 上优于 SlowFast-R101,但在 TAD 上反而更差。这说明 CNN 系 backbone 学到的特征在时序定位上存在不匹配,ViT 系(尤其是经过自监督预训练的 VFM)才是 TAD 的最佳 backbone 选择。

4.3 FreeZAD:完全无需训练的零样本 TAD

FreeZAD #Han et al., 2025 走了一条完全不同的路线——完全不训练任何参数,直接利用预训练 CoCa(ViT-L/14)的冻结特征做时序动作检测。

方法分三步:(1) 用 CoCa 视觉编码器逐帧提取 RGB 特征,文本编码器将候选类别映射为原型;(2) 原型引导逐帧相似度计算,经平滑和阈值化生成候选片段;(3) 设计 LogOIC(对数衰减加权 Outer-Inner-Contrastive 分数)增强边界敏感性,并通过基于 FFT 的 Actionness Calibration 利用频率能量修正置信度。

方法类型THU mAPANet mAPFPS显存
DeTAL全监督25.3%25.8%
T3AL无监督9.2%15.4%10.18.6 GB
FreeZAD无训练10.0%18.3%128.93.3 GB
AdaZADTTA14.0%19.3%28.43.7 GB

FreeZAD 的推理速度是 T3AL 的 12.8 倍,显存仅为 38%。AdaZAD 通过轻量测试时适配(仅 1.2M 参数)将 mAP 从 10.0% 提升至 14.0%(+40%),在 ActivityNet 上甚至超过有监督方法 Eff-Prompt(23.1% → 19.3%,差距仅 3.8%)。但 THUMOS14 上零样本(10.0%)与全监督(DeTAL 25.3%)仍有 15% 的绝对差距,Oracle 分析指出完美标签可提升 1.3%,完美采样提升 3.6%——伪标签质量是主要瓶颈。

4.4 端到端 TAD 的兴起

OpenTAD 还揭示了一条新兴路线:端到端训练。AdaTAD 使用 VideoMAEv2-G backbone + adapter tuning 在 THUMOS14 上达到 77.07% Avg mAP,远超所有特征提取方法(最高 73.42%)。这暗示了未来 TAD 的最优范式可能不是"先预训练 VFM,再提取特征",而是"VFM 做 backbone,端到端微调"。

端到端 vs 两阶段的权衡

端到端训练消除了离线特征提取的信息损失,但需要 GPU 常驻大模型(VideoMAEv2-G 约 1B 参数)。两阶段方法可以离线提取特征后反复实验检测头设计,更适合研究迭代。OpenTAD 的代码库同时支持两种范式。

Part 5
视频语言模型——从识别到理解

5.1 VideoLLaMA 3:vision-centric 范式

VideoLLaMA 3 #Wang et al., 2025 代表了一种激进的设计哲学:高质量图像理解是视频理解的基础。与准备海量视频-文本数据集不同,VideoLLaMA 3 聚焦于构建大规模高质量图文数据集(>60M),视频数据仅约 6M。

训练分为 4 个阶段:(1) Vision Encoder Adaptation——用 2D-RoPE 替换 SigLIP 的绝对位置编码,支持任意分辨率输入;(2) Vision-Language Alignment——27.2M 图文数据全参数对齐;(3) Multi-task Fine-tuning——引入 2.92M 通用视频数据和 DiffFP 视频压缩器;(4) Video-centric Fine-tuning——增强时间定位能力。

结果:2B 模型在 13 项视频基准中 12 项最优,7B 模型全部 8 项最优。ActivityNet-QA(动作理解)达到 61.3,PerceptionTest(动作感知)达到 72.8,Charades-STA(时间定位)达到 60.7

5.2 VLM 的时间定位能力

能力维度VideoLLaMA3 7BV-JEPA 2InternVideo2
动作理解(ActivityNet-QA)61.3
动作感知(PerceptionTest)72.8
时间定位(Charades-STA)60.7
运动理解(SSv2 Top-1)77.377.5
视频 QA 平均SOTA59.5

这揭示了一个有趣的互补性:V-JEPA 2 擅长运动表征和预测,VideoLLaMA 3 擅长语言理解和多模态推理。两者结合(V-JEPA 2 编码器作为 VLM 的视觉 backbone)可能产生更强的 TAD 系统。

5.3 UniFormerV2:图像预训练迁移的极致

UniFormerV2 #Li et al., 2022 证明了一个反直觉的结论:不需要视频预训练,仅用 CLIP-400M 图像预训练的 ViT 加上轻量时序模块,5 epoch 微调即可在 K400 上达到 90.0%——首次突破 90% 大关。

其 Local UniBlock 在 ViT 块前插入局部时序 MHRA(参数仅 $t \times 1 \times 1$),Global UniBlock 用交叉注意力将复杂度从 $O(L^2)$ 降至 $O(L)$。B/16 模型仅 3.6T FLOPs(Swin-L 的 1/29),达到 83.4% K400。

这意味着对于资源有限的实际场景(如系列四讨论的边缘部署),UniFormerV2 的"图像预训练 + 极少微调"范式可能是最实用的 VFM 迁移方案。

Part 6
实验全景与量化对比

6.1 动作识别性能总表

模型K400SSv2UCF101HMDB51MiTANet
InternVideo2-6B92.177.597.380.751.295.9
V-JEPA 2 ViT-g87.377.3
UniFormerV2-L/1490.073.0
VideoMamba-M85.071.4
RVM-H60.068.7
VideoMAEv2-g90.077.0

6.2 TAD 性能总表

方法BackboneTHUMOS14 mAPActivityNet mAP类型
OpenTAD (ActionFormer+)InternVideo2-6B73.42%39.51%全监督
AdaTADVideoMAEv2-G77.07%端到端
InternVideo2 直用ViT-6B72.0%41.2%特征提取
VideoMambaSuiteInternVideo2-6B69.57%37.45%全监督
AdaZADCoCa ViT-L/1414.0%19.3%TTA
FreeZADCoCa ViT-L/1410.0%18.3%无训练

6.3 预训练成本与效率对比

模型预训练硬件训练时长数据规模效率亮点
InternVideo2-6B256 A10035 天402M 条目渐进式三阶段训练
V-JEPA 2 ViT-g22M clips渐进式分辨率 8.4× 加速
VideoMamba-MCLIP-400M推理 6× 加速,40× 显存
UniFormerV2-L/145 epochCLIP + K7105 epoch 即达 SOTA
RVM-S256 TPU-v61M steps8.4M clips34M 参数,无蒸馏
Part 7
在地图上的位置

与已有系列文章的关系

文章覆盖范围本文的差异视角
系列一·导览7 条技术路线概览深入 VFM 范式的技术细节
系列二·动物动物动作识别全景VFM 跨物种迁移(未来方向)
系列四·选型mmaction2 + 边缘部署VFM 前沿方法 + 云端训练
系列五·CG→FG粗粒度到细粒度综述VFM 作为 CG→FG 的潜在解决方案
VideoMAE 精读VideoMAE V1 深度解读覆盖 V2 及后续所有演进

六个开放问题

  1. VFM 特征 vs 端到端训练:AdaTAD(端到端,77.07% THU)远超特征提取方法(73.42%),但需要 1B 参数模型常驻 GPU。最优范式取决于部署约束。
  2. 长视频 TAD:RVM 的线性推理复杂度和 80+ 帧特征稳定性、VideoMamba 的 6× 加速,是否意味着 SSM/RNN 在长视频 TAD 上碾压 Transformer?ActivityNet 平均 180 秒视频是最佳测试场。
  3. 零样本精度上限:FreeZAD 与全监督方法有 15% 绝对差距。Oracle 分析指出伪标签质量是瓶颈,但 1.2M 参数的 AdaZAD 就能缩小到 11%——轻量适配是否是零样本 TAD 的最佳出路?
  4. 多模态 VFM:InternVideo2 的四模态对比学习(视频+音频+语音+文本)表明多模态互利互惠。音频特征对 TAD(尤其是包含语音指令的动作)有多大增益?
  5. VFM 跨物种迁移系列五揭示 FG 动物动作识别仅 12.7-29.6% 准确率。VFM 的通用表征能否作为 CG→FG 的 bridge?V-JEPA 2 在运动理解上的强势表现值得关注。
  6. 边缘部署系列四讨论了 500 元 BOM 约束。VideoMamba 的 SSM 算子在 TensorRT/NCNN 上仍无原生支持,UniFormerV2-B/16(3.6T FLOPs)和 RVM-S(34M)是当前最可行的候选。

可操作启发

如果要在实际项目中使用视频基础模型做动作检测,当前的最佳实践路径是:

  • 云端高精度:InternVideo2-6B backbone + OpenTAD 最优 Neck/Head → ActivityNet 39.51%, THUMOS14 73.42%
  • 资源受限:UniFormerV2-B/16 + K710 中间训练 + 5 epoch 微调 → K400 83.4%, 仅 3.6T FLOPs
  • 零样本快速部署:FreeZAD(CoCa 冻结)→ 128.9 FPS, 3.3 GB 显存, 无需训练
  • 长视频监控:VideoMamba-M 或 RVM → 线性推理复杂度, 特征长期稳定

参考来源

  • Wang, Y. et al. (2024). InternVideo2: Scaling Foundation Models for Multimodal Video Understanding. ECCV 2024. arXiv:2403.15377
  • Bardes, A. et al. (2025). V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning. Meta FAIR. arXiv:2506.09985
  • Zhu, Z. et al. (2024). VideoMamba: State Space Model for Efficient Video Understanding. ECCV 2024. arXiv:2403.06977
  • Liu, J. et al. (2025). OpenTAD: A Unified Framework and Comprehensive Study of Temporal Action Detection. arXiv:2502.20361
  • Han, C. et al. (2025). FreeZAD: Training-Free Zero-Shot Temporal Action Detection with Vision-Language Models. IEEE TMM 2026. arXiv:2501.13795
  • Li, K. et al. (2022). UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer. ICLR 2024. arXiv:2211.09552
  • Wang, K. et al. (2025). VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding. arXiv:2501.13106
  • Recasens, A. et al. (2025). Recurrent Video Masked Autoencoders. Google DeepMind. CVPR 2026. arXiv:2512.13684
  • Wang, Z. et al. (2023). VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking. CVPR 2023. arXiv:2303.16727
  • Wang, Y. et al. (2022). InternVideo: General Video Foundation Models via Generative and Discriminative Learning. arXiv:2212.03191
  • Liu, Z. et al. (2022). VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training. NeurIPS 2022. arXiv:2203.12602
  • Bardes, A. et al. (2024). V-JEPA: Video Joint Embedding Predictive Architecture. Meta FAIR. arXiv:2404.16790