动作识别系列总览
动作识别(Action Recognition)是计算机视觉的核心任务之一:给定一段视频,判断其中发生了什么动作。它看似简单——不过是视频级的图像分类——但真正的难点在于:动作信息分布在时间维度上,一帧画面看不出来"跑步"和"站立"的区别,必须建模帧与帧之间的时序关系。
这个系列梳理了动作识别从 2014 年 Two-Stream CNN 到 2026 年 InternVideo3 的完整技术演进,覆盖 7 条主要技术路线、40+ 篇代表论文、4 大主流框架和完整的部署工具链。无论你是想快速入门、选定 baseline、还是追踪前沿,这里都提供了一条清晰的路。
动作识别的方法演进可以用一句话概括:从手工设计时序建模,到让网络自己学时序,再到用自监督预训练让模型自己理解视频。
| 路线 | 时期 | 核心思想 | 代表方法 | 典型精度 (K400) |
|---|---|---|---|---|
| 2D CNN + 时序策略 | 2014–2018 | 用 2D CNN 提取帧特征,靠双流(RGB+光流)或稀疏采样策略建模时序 | Two-Stream, TSN, TSM | ~74% |
| 3D CNN | 2015–2020 | 用 3D 卷积直接在时空维度上提取特征 | C3D, I3D, SlowFast, X3D | ~80% |
| Video Transformer | 2021–至今 | 用自注意力替代卷积建模时空关系 | TimeSformer, ViViT, Video Swin, VideoMAE | 84.9%–91.0% |
| Skeleton-Based | 2018–至今 | 从骨架序列中识别动作,用图卷积建模人体拓扑 | ST-GCN, 2s-AGCN, CTR-GCN, PoseConv3D | NTU60: ~92% |
| 视频基础模型 | 2022–至今 | 用大规模自监督预训练+多模态对齐构建通用视频理解器 | InternVideo, VideoMAE V2, VideoMamba | 91.0%+ |
| 多模态融合 | 2019–至今 | 融合 RGB + 光流 + 音频 + 骨架等多种模态 | ActionCLIP, VindLU, MAiVAR | — |
| 轻量化 / 边缘部署 | 2019–至今 | 面向移动端和边缘设备的实时动作识别 | X3D, MoViNet, TSM-Mobile, MobileOne | — |
📚 章节目录
关键问题:如何在不引入 3D 卷积的前提下让网络"看到"时间?
- Two-Stream CNN (NeurIPS 2014)
- TSN: Temporal Segment Networks (TPAMI 2016)
- TSM: Temporal Shift Module (ICCV 2019)
- Hidden Two-Stream (ACCV 2018)
关键问题:3D 卷积的时空分辨率如何平衡?预训练从哪来?
- C3D (ICCV 2015)
- I3D / Quo Vadis (CVPR 2017)
- SlowFast Networks (ICCV 2019)
- X3D: Expanding Architectures (CVPR 2020)
关键问题:纯注意力是否足够建模时空?如何解决视频数据量不足?
- TimeSformer (ICML 2021)
- ViViT (ICCV 2021)
- Video Swin Transformer (CVPR 2022)
- VideoMAE / VideoMAE V2 (NeurIPS 2022 / CVPR 2023)
- UniFormer V1/V2 (ICLR 2022)
关键问题:人体拓扑是固定的还是可学习的?骨架 vs RGB 谁更本质?
- ST-GCN (AAAI 2018)
- 2s-AGCN (CVPR 2019)
- CTR-GCN (ICCV 2021)
- PoseConv3D (CVPR 2022)
关键问题:专用模型 vs 基础模型,什么场景该用哪个?
- InternVideo / InternVideo2 / 2.5 / 3 (2022–2026)
- VideoMamba (ICML 2024)
- ActionCLIP (NeurIPS 2021)
关键问题:如何在不大幅掉点的前提下把模型塞进手机?
- X3D (CVPR 2020)
- MoViNet (CVPR 2021)
- TSM-Mobile (TPAMI 2021)
- MMDeploy 部署链
关键问题:如何在数据极度稀缺、物种极度分散的情况下做泛化?
- Animal Kingdom (CVPR 2022) — 标杆数据集
- AnimalMotionCLIP — CLIP + 运动嵌入
- ARTEMIS — 多模态 SOTA mAP 79.82
- SuperAnimal (Nature Comm. 2024) — 跨物种姿态估计
文章关系图
22 篇文章 · 108 条连接
🧰 主流框架对比
动作识别的工程生态已经分裂为两条路线:传统专用框架(MMAction2、PySlowFast)专注 action recognition 任务全流程;视频基础模型(InternVideo 系列)用统一多模态架构覆盖更广泛的视频理解任务。
| 框架 | 维护方 | 状态 | 模型数 | 定位 | 推荐场景 |
|---|---|---|---|---|---|
| MMAction2 | OpenMMLab | 低活跃维护 | 27+ 算法 | 完整训练+评测工具箱 | 首选:研究、Benchmark、工业训练 |
| PySlowFast | FAIR | 接近停滞 | ~10 backbone | SOTA 研究代码库 | 复现 FAIR 论文、AVA 检测 |
| PyTorchVideo | FAIR | 实质停更 | ~15 组件 | 模块化组件库 | 快速推理(torch.hub 一行加载) |
| InternVideo | OpenGVLab | 极其活跃 | 全系列 | 视频基础模型 | 开放词汇识别、视频问答、多模态 |
| MoViNet (TF) | 活跃 | A0–A5 | 流式视频识别 | TFLite 移动端 / Web 部署 |
torch.hub.load);做开放词汇或多模态用 InternVideo2.5/3;移动端部署用 MoViNet + TFLite 或 X3D + MMDeploy + ncnn。
MMAction2 支持的方法清单
RGB 分类:C3D, TSN, I3D, R(2+1)D, CSN, TPN, X3D, SlowFast, TimeSformer, MViT V2, Video Swin, UniFormer V1/V2, VideoMAE, VideoMAE V2, ActionCLIP
骨架识别:ST-GCN, ST-GCN++, 2s-AGCN, CTR-GCN, PoseConv3D, AGCN, MSG3D, MS-G3D
数据集:Kinetics-{400,600,700}, UCF101, HMDB51, Something-Something V2, AVA, ActivityNet, NTU-RGB+D/120, FineDiving 等 20+
部署:通过 MMDeploy 支持 TensorRT / ONNX Runtime / ncnn / CoreML / OpenVINO / TFLite
📖 论文池速查
以下按技术路线分组,标注每篇论文的角色和核心贡献。详细精读文章将逐步发布。
必读经典(Must-Read)
| 论文 | 年份 | 路线 | 核心贡献 |
|---|---|---|---|
| Two-Stream CNN | 2014 | 2D CNN | 空间流(RGB)+ 时间流(光流)双流范式开山 |
| TSN | 2016 | 2D CNN | 稀疏时序采样 + 多片段融合,长视频建模 |
| C3D | 2015 | 3D CNN | 3×3×3 卷积统一时空特征提取 |
| I3D | 2017 | 3D CNN | 膨胀 2D→3D + Kinetics 预训练 |
| SlowFast | 2019 | 3D CNN | 双速通道:慢路径看语义、快路径看运动 |
| X3D | 2020 | 3D CNN | 6 轴渐进扩张,4.8× 计算量减低 |
| TSM | 2019 | 时序建模 | 零计算量时序通道位移 |
| TimeSformer | 2021 | Transformer | 首个纯时空自注意力视频分类 |
| ViViT | 2021 | Transformer | 因子化时空注意力(4 种变体) |
| Video Swin | 2022 | Transformer | 局部归纳偏置 + 3D 移位窗口,K400 84.9% |
| VideoMAE | 2022 | Transformer | 90% 极高掩码率自监督预训练 |
| VideoMAE V2 | 2023 | Transformer | 双掩码 + 亿级参数,K400 90.0% |
| ST-GCN | 2018 | Skeleton | 时空图卷积骨架识别开山 |
| 2s-AGCN | 2019 | Skeleton | 自适应图 + 关节/骨骼双流 |
| InternVideo | 2022 | 基础模型 | 统一掩码视频 + 视频-语言对比学习 |
| VideoMamba | 2024 | 基础模型 | 状态空间模型,线性复杂度视频建模 |
核心综述(Core Survey)
| 论文 | 年份 | 覆盖范围 |
|---|---|---|
| A Comprehensive Study of Deep Video Action Recognition | 2020 | 200+ 论文综合盘点,17 数据集 benchmark |
| Vision Transformers for Action Recognition: A Survey | 2022 | ViT 动作识别专项综述(架构/模态/目标三维分类) |
| Spatio-temporal Action Recognition: A Survey | 2019 | 时空动作检测专项 |
🗺️ 研究路径
📋 待规划专题
| 专题 | 类型 | 状态 |
|---|---|---|
| 动物动作识别:从数据稀缺到基础模型的破局之路 | 系列综述 | ✅ 已发布 |
| 从粗粒度到细粒度的动物动作识别综述 | 系列综述 | ✅ 已发布 |
| 视频基础模型时代的动作检测——从掩码重建到零样本泛化 | 系列综述 | ✅ 已发布 |
| 个体特定动作检测——先认识"这只猫",再理解"它在做什么" | 系列综述 | ✅ 已发布 |
| 2D CNN 到 3D CNN 的范式转换 | 系列综述 | 📝 待写 |
| Video Transformer 架构设计空间 | 系列综述 | 📝 待写 |
| VideoMAE:数据高效的视频自监督预训练 | 论文精读 | ✅ 已发布 |
| SlowFast Networks:双速通道的时空建模 | 论文精读 | ✅ 已发布 |
| IGMN:首个身份感知时序动作检测 | 论文精读 | ✅ 已发布 |
| SkeleTR:两阶段骨架动作识别的标杆 | 论文精读 | ✅ 已发布 |
| MammalNet:539 小时哺乳动物视频基准与组合零样本评测 | 论文精读 | ✅ 已发布 |
| Animal Kingdom:850 物种行为理解标杆数据集 | 论文精读 | ✅ 已发布 |
| Animal-CLIP:双 Prompt 增强的物种感知 VLM | 论文精读 | ✅ 已发布 |
| ST-GCN 时空图卷积原理 | 论文精读 | 📝 待写 |
| MMAction2 源码解读与自定义训练 | 工程解读 | 📝 待写 |
| X3D 移动端部署实战 | 工程解读 | 📝 待写 |
| VideoMamba:状态空间模型在视频中的应用 | 论文精读 | ↗ 见系列六 |
| InternVideo 视频基础模型演进 | 系列综述 | ↗ 见系列六 |
| Kinetics 数据集分析与训练策略 | 专题 | 📝 待写 |
🐾 动物动作识别论文精读
覆盖宠物动作检测、动物姿态估计、动物行为分类、跨物种泛化等广义动物动作识别论文。已发布文章在 3 级路径 categories/AI/动作识别/宠物动作识别 下独立编号。
| sub_id | 论文 | 核心主题 | 状态 |
|---|---|---|---|
| 10 | 端侧宠物行为识别 Phase 1 | 宠物行为检测 | ✅ 已发布 |
| 20 | mmaction2 到 VideoMamba 选型 | 模型选型 | ✅ 已发布 |
| 30 | PMTNet 猫咪行为识别 | 宠物行为分类 | ✅ 已发布 |
| 40 | 数据集全景汇总与缺口分析 | 数据 & 缺口 | ✅ 已发布 |
| 50 | 非视觉模态全景 | 8 种输入模态选型 | ✅ 已发布 |
| 60+ | SuperAnimal 跨物种姿态估计 | 动物姿态基础模型 | ✅ 已发布 |
| — | IGMN 身份感知动作检测 | 身份感知 TAD(已归入动作识别论文精读) | ✅ 已发布 |
| — | SkeleTR 两阶段骨架 AR | 个体内+个体间解耦(已归入动作识别论文精读) | ✅ 已发布 |
| 60+ | DiffPose-Animal 扩散动物姿态 | LLM 引导扩散 | 📝 待写 |
| 70+ | AniMer 动物姿态+形状估计 | 3D 个体重建 | 📝 待写 |
| 80+ | PoseBridge 零样本骨架 AR | 零样本泛化 | 📝 待写 |