ESC
输入关键词搜索文章
目录

动作识别系列总览

从双流 CNN 到视频基础模型
技术路线 · 论文池 · 框架选型 · 部署指南
系列总纲
关于这个系列

动作识别(Action Recognition)是计算机视觉的核心任务之一:给定一段视频,判断其中发生了什么动作。它看似简单——不过是视频级的图像分类——但真正的难点在于:动作信息分布在时间维度上,一帧画面看不出来"跑步"和"站立"的区别,必须建模帧与帧之间的时序关系。

这个系列梳理了动作识别从 2014 年 Two-Stream CNN 到 2026 年 InternVideo3 的完整技术演进,覆盖 7 条主要技术路线、40+ 篇代表论文、4 大主流框架和完整的部署工具链。无论你是想快速入门、选定 baseline、还是追踪前沿,这里都提供了一条清晰的路。

🗺️ 技术路线全景

动作识别的方法演进可以用一句话概括:从手工设计时序建模,到让网络自己学时序,再到用自监督预训练让模型自己理解视频

路线时期核心思想代表方法典型精度 (K400)
2D CNN + 时序策略2014–2018用 2D CNN 提取帧特征,靠双流(RGB+光流)或稀疏采样策略建模时序Two-Stream, TSN, TSM~74%
3D CNN2015–2020用 3D 卷积直接在时空维度上提取特征C3D, I3D, SlowFast, X3D~80%
Video Transformer2021–至今用自注意力替代卷积建模时空关系TimeSformer, ViViT, Video Swin, VideoMAE84.9%–91.0%
Skeleton-Based2018–至今从骨架序列中识别动作,用图卷积建模人体拓扑ST-GCN, 2s-AGCN, CTR-GCN, PoseConv3DNTU60: ~92%
视频基础模型2022–至今用大规模自监督预训练+多模态对齐构建通用视频理解器InternVideo, VideoMAE V2, VideoMamba91.0%+
多模态融合2019–至今融合 RGB + 光流 + 音频 + 骨架等多种模态ActionCLIP, VindLU, MAiVAR
轻量化 / 边缘部署2019–至今面向移动端和边缘设备的实时动作识别X3D, MoViNet, TSM-Mobile, MobileOne

📚 章节目录

排序:
2014 — 2018
2D CNN 时代:双流与稀疏采样

Two-Stream 开创了空间流(RGB)+ 时间流(光流)的双流范式;TSN 用稀疏时序分段采样解决了长视频建模问题;TSM 以零计算量的通道位移实现了 2D CNN 上的时序建模。这一阶段的核心矛盾是:2D CNN 无法直接建模时序,需要额外的时序策略。

关键问题:如何在不引入 3D 卷积的前提下让网络"看到"时间?

  • Two-Stream CNN (NeurIPS 2014)
  • TSN: Temporal Segment Networks (TPAMI 2016)
  • TSM: Temporal Shift Module (ICCV 2019)
  • Hidden Two-Stream (ACCV 2018)
2015 — 2020
3D CNN 时代:时空联合卷积

C3D 证明了 3×3×3 卷积可以直接学习时空特征;I3D 将 ImageNet 预训练的 2D 卷积核膨胀为 3D,利用了大规模图像预训练的优势;SlowFast 用双速通道(慢路径看语义、快路径看运动)刷新了 SOTA;X3D 通过渐进式网络扩张实现了 4.8× 计算量减低。

关键问题:3D 卷积的时空分辨率如何平衡?预训练从哪来?

  • C3D (ICCV 2015)
  • I3D / Quo Vadis (CVPR 2017)
  • SlowFast Networks (ICCV 2019)
  • X3D: Expanding Architectures (CVPR 2020)
2021 — 至今
Video Transformer:注意力即一切

TimeSformer 首次验证了纯时空自注意力可以做视频分类;ViViT 系统研究了时空注意力的因子化策略;Video Swin 引入了局部归纳偏置(3D 移位窗口);VideoMAE 用 90% 极高掩码率的自监督预训练引爆了视频 ViT 的数据效率。

关键问题:纯注意力是否足够建模时空?如何解决视频数据量不足?

  • TimeSformer (ICML 2021)
  • ViViT (ICCV 2021)
  • Video Swin Transformer (CVPR 2022)
  • VideoMAE / VideoMAE V2 (NeurIPS 2022 / CVPR 2023)
  • UniFormer V1/V2 (ICLR 2022)
2018 — 至今
Skeleton-Based:骨架序列建模

ST-GCN 将人体关节点建模为时空图,用图卷积在关节拓扑上传播信息;2s-AGCN 引入自适应图结构和骨骼双流;CTR-GCN 用多尺度时空相关性增强;PoseConv3D 从 GCN 路线转向 3D 热力图堆叠。近期趋势是 Skeleton + Mamba 和零样本骨架识别。

关键问题:人体拓扑是固定的还是可学习的?骨架 vs RGB 谁更本质?

  • ST-GCN (AAAI 2018)
  • 2s-AGCN (CVPR 2019)
  • CTR-GCN (ICCV 2021)
  • PoseConv3D (CVPR 2022)
2022 — 至今
视频基础模型:自监督 + 多模态

InternVideo 系列开创了通用视频基础模型范式:用掩码视频学习 + 视频-语言对比学习构建统一表示。VideoMAE V2 将 ViT 扩展到亿级参数。VideoMamba 用状态空间模型实现了线性复杂度的视频建模。InternVideo3(2026.06)代表了当前最前沿。

关键问题:专用模型 vs 基础模型,什么场景该用哪个?

  • InternVideo / InternVideo2 / 2.5 / 3 (2022–2026)
  • VideoMamba (ICML 2024)
  • ActionCLIP (NeurIPS 2021)
2019 — 至今
轻量化与边缘部署

X3D 面向移动端设计高效 3D 架构;MoViNet 用因果卷积+流缓冲实现流式推理;TSM 在 Jetson Nano 上达到 13ms 延迟。部署侧则由 MMDeploy 统一对接 TensorRT / ONNX Runtime / ncnn / CoreML 等推理后端。

关键问题:如何在不大幅掉点的前提下把模型塞进手机?

  • X3D (CVPR 2020)
  • MoViNet (CVPR 2021)
  • TSM-Mobile (TPAMI 2021)
  • MMDeploy 部署链
2022 — 至今
🐾 动物动作识别

与人体动作识别完全不同的技术路线:数据稀缺(最大 MammalNet 仅 539h)、物种长尾分布(Animal Kingdom 850 物种)、骨架不统一。核心趋势是用视频基础模型(V-JEPA, CLIP)的零样本能力破局。SuperAnimal 跨 45+ 物种姿态估计让 pipeline 变得可行。

关键问题:如何在数据极度稀缺、物种极度分散的情况下做泛化?

  • Animal Kingdom (CVPR 2022) — 标杆数据集
  • AnimalMotionCLIP — CLIP + 运动嵌入
  • ARTEMIS — 多模态 SOTA mAP 79.82
  • SuperAnimal (Nature Comm. 2024) — 跨物种姿态估计

文章关系图

22 篇文章 · 108 条连接

🧰 主流框架对比

动作识别的工程生态已经分裂为两条路线:传统专用框架(MMAction2、PySlowFast)专注 action recognition 任务全流程;视频基础模型(InternVideo 系列)用统一多模态架构覆盖更广泛的视频理解任务。

框架维护方状态模型数定位推荐场景
MMAction2OpenMMLab低活跃维护27+ 算法完整训练+评测工具箱首选:研究、Benchmark、工业训练
PySlowFastFAIR接近停滞~10 backboneSOTA 研究代码库复现 FAIR 论文、AVA 检测
PyTorchVideoFAIR实质停更~15 组件模块化组件库快速推理(torch.hub 一行加载)
InternVideoOpenGVLab极其活跃全系列视频基础模型开放词汇识别、视频问答、多模态
MoViNet (TF)Google活跃A0–A5流式视频识别TFLite 移动端 / Web 部署
选型建议:开新项目首选 MMAction2(生态最完整,覆盖 RGB / 骨架 / 光流 / 音频);只需加载预训练模型推理用 PyTorchVideotorch.hub.load);做开放词汇或多模态用 InternVideo2.5/3;移动端部署用 MoViNet + TFLiteX3D + MMDeploy + ncnn

MMAction2 支持的方法清单

RGB 分类:C3D, TSN, I3D, R(2+1)D, CSN, TPN, X3D, SlowFast, TimeSformer, MViT V2, Video Swin, UniFormer V1/V2, VideoMAE, VideoMAE V2, ActionCLIP

骨架识别:ST-GCN, ST-GCN++, 2s-AGCN, CTR-GCN, PoseConv3D, AGCN, MSG3D, MS-G3D

数据集:Kinetics-{400,600,700}, UCF101, HMDB51, Something-Something V2, AVA, ActivityNet, NTU-RGB+D/120, FineDiving 等 20+

部署:通过 MMDeploy 支持 TensorRT / ONNX Runtime / ncnn / CoreML / OpenVINO / TFLite

📖 论文池速查

以下按技术路线分组,标注每篇论文的角色和核心贡献。详细精读文章将逐步发布。

必读经典(Must-Read)

论文年份路线核心贡献
Two-Stream CNN20142D CNN空间流(RGB)+ 时间流(光流)双流范式开山
TSN20162D CNN稀疏时序采样 + 多片段融合,长视频建模
C3D20153D CNN3×3×3 卷积统一时空特征提取
I3D20173D CNN膨胀 2D→3D + Kinetics 预训练
SlowFast20193D CNN双速通道:慢路径看语义、快路径看运动
X3D20203D CNN6 轴渐进扩张,4.8× 计算量减低
TSM2019时序建模零计算量时序通道位移
TimeSformer2021Transformer首个纯时空自注意力视频分类
ViViT2021Transformer因子化时空注意力(4 种变体)
Video Swin2022Transformer局部归纳偏置 + 3D 移位窗口,K400 84.9%
VideoMAE2022Transformer90% 极高掩码率自监督预训练
VideoMAE V22023Transformer双掩码 + 亿级参数,K400 90.0%
ST-GCN2018Skeleton时空图卷积骨架识别开山
2s-AGCN2019Skeleton自适应图 + 关节/骨骼双流
InternVideo2022基础模型统一掩码视频 + 视频-语言对比学习
VideoMamba2024基础模型状态空间模型,线性复杂度视频建模

核心综述(Core Survey)

论文年份覆盖范围
A Comprehensive Study of Deep Video Action Recognition2020200+ 论文综合盘点,17 数据集 benchmark
Vision Transformers for Action Recognition: A Survey2022ViT 动作识别专项综述(架构/模态/目标三维分类)
Spatio-temporal Action Recognition: A Survey2019时空动作检测专项

🗺️ 研究路径

路径一:快速入门(工程优先)

先读 Hub 总览 → 阅读「动作识别领域导览」了解全局 → 安装 MMAction2 → 跑通 TSN / SlowFast 在 UCF101 上的训练 → 用预训练 VideoMAE 做 Kinetics-400 推理。建议 1-2 天完成。

路径二:按路线深入(研究优先)

按技术演进顺序读论文:Two-Stream → TSN → C3D → I3D → SlowFast → X3D → TimeSformer → VideoMAE 精读 → InternVideo。每篇读 original paper + 对应的精读文章(逐步发布中)。

路径三:骨架动作识别

从 ST-GCN 入门图卷积骨架建模 → 2s-AGCN 理解自适应图与双流 → CTR-GCN 看多尺度增强 → PoseConv3D 体验 GCN 到 CNN 的范式转换。用 MMAction2 skeleton 模块 + NTU-RGB+D 数据集实践。

路径四:移动端 / 边缘部署

选 X3D 或 MoViNet 作为基础模型 → 用 MMDeploy 导出 ONNX / TensorRT / ncnn → 在目标设备上 benchmark → 配合 TSM / MobileOne 做精度-速度 trade-off。

📋 待规划专题

专题类型状态
动物动作识别:从数据稀缺到基础模型的破局之路系列综述✅ 已发布
从粗粒度到细粒度的动物动作识别综述系列综述✅ 已发布
视频基础模型时代的动作检测——从掩码重建到零样本泛化系列综述✅ 已发布
个体特定动作检测——先认识"这只猫",再理解"它在做什么"系列综述✅ 已发布
2D CNN 到 3D CNN 的范式转换系列综述📝 待写
Video Transformer 架构设计空间系列综述📝 待写
VideoMAE:数据高效的视频自监督预训练论文精读✅ 已发布
SlowFast Networks:双速通道的时空建模论文精读✅ 已发布
IGMN:首个身份感知时序动作检测论文精读✅ 已发布
SkeleTR:两阶段骨架动作识别的标杆论文精读✅ 已发布
MammalNet:539 小时哺乳动物视频基准与组合零样本评测论文精读✅ 已发布
Animal Kingdom:850 物种行为理解标杆数据集论文精读✅ 已发布
Animal-CLIP:双 Prompt 增强的物种感知 VLM论文精读✅ 已发布
ST-GCN 时空图卷积原理论文精读📝 待写
MMAction2 源码解读与自定义训练工程解读📝 待写
X3D 移动端部署实战工程解读📝 待写
VideoMamba:状态空间模型在视频中的应用论文精读↗ 见系列六
InternVideo 视频基础模型演进系列综述↗ 见系列六
Kinetics 数据集分析与训练策略专题📝 待写

🐾 动物动作识别论文精读

覆盖宠物动作检测、动物姿态估计、动物行为分类、跨物种泛化等广义动物动作识别论文。已发布文章在 3 级路径 categories/AI/动作识别/宠物动作识别 下独立编号。

sub_id论文核心主题状态
10端侧宠物行为识别 Phase 1宠物行为检测✅ 已发布
20mmaction2 到 VideoMamba 选型模型选型✅ 已发布
30PMTNet 猫咪行为识别宠物行为分类✅ 已发布
40数据集全景汇总与缺口分析数据 & 缺口✅ 已发布
50非视觉模态全景8 种输入模态选型✅ 已发布
60+SuperAnimal 跨物种姿态估计动物姿态基础模型✅ 已发布
IGMN 身份感知动作检测身份感知 TAD(已归入动作识别论文精读)✅ 已发布
SkeleTR 两阶段骨架 AR个体内+个体间解耦(已归入动作识别论文精读)✅ 已发布
60+DiffPose-Animal 扩散动物姿态LLM 引导扩散📝 待写
70+AniMer 动物姿态+形状估计3D 个体重建📝 待写
80+PoseBridge 零样本骨架 AR零样本泛化📝 待写