ESC
输入关键词搜索文章
目录

动作检测模型全景

mmaction2 · VideoMamba · 动物行为 · 边缘部署
25+ 模型 × 9 个数据集 × 6 种输入模态,在 500 元 BOM 约束下寻找猫咪行为识别的最优解
25+调研模型
9动物数据集
3技术路线
90%K400 SOTA
概述
为什么要做这次调研

第一阶段任务规划 中我们定义了三条任务线,本文是任务 1(现有模型调研与方法总结)的交付物。

核心问题只有一个:现有动作检测模型在动物(尤其是猫)行为识别上能做到什么程度? 要回答这个问题,需要同时摸清三个层面:

  1. mmaction2 工具链里有什么——这是验证的第一站,OpenMMLab 生态覆盖了 2014-2023 年的主流模型
  2. 2023-2026 年冒出了什么新东西——VideoMamba、VideoMAE V2、视频基础模型,mmaction2 还没来得及收录
  3. 动物行为识别领域已经做了什么——数据集、方法、跨物种迁移的可行性
本文定位:技术路线全景图 + 选型决策依据。不是论文精读,而是为项目选定 1-2 个主力模型 + 备选方案的快速参考。
技术路线全景
从 CNN 到 Mamba:三条技术路线的演进

动作识别的架构演进可以归纳为三波浪潮,每一波都在解决前一波的核心瓶颈:

flowchart LR
  subgraph CNN["第一波:CNN 时代"]
    direction TB
    C1["2D CNN
TSN/TSM
轻量但无显式运动建模"] C2["3D CNN
I3D/SlowFast/X3D
显式时空建模但计算量大"] end subgraph TR["第二波:Transformer 时代"] direction TB T1["Video Transformer
TimeSformer/MViT/UniFormer
长程依赖建模但 O(N²)"] T2["掩码预训练
VideoMAE/V2
自监督+规模化的胜利"] end subgraph SM["第三波:SSM 时代"] direction TB S1["Video Mamba
线性复杂度
长序列优势"] S2["混合架构
SSM + Attention
互补补偿"] end CNN --> TR --> SM

输入模态全景:从 RGB 到稀疏轨迹

与架构演进正交的是输入模态的选择。传统上动作识别主要依赖 RGB 和骨架两条路线,但 2024-2026 年出现了多种新的输入表示:

模态代表方法输入形式计算量猫场景适配
RGBSlowFast, X3D, VideoMamba, VideoMAE原始视频帧大(GB 级 FLOPs)首选 — 信息完整
SkeletonST-GCN, PoseC3D, SkateFormer关键点序列极小需猫姿态估计
RGB-D / DepthDEAR, MAGNetRGB + 深度图中(双流)可行 — 单目估计即可
稀疏轨迹TrAction (2026)CoTracker3 点轨迹潜力 — 纯运动驱动
3D 点云3DInAction, Motion PointNet点云序列中-高困难 — 需深度传感器
事件相机POKER (CVPR 2026)异步事件流极低不成熟 — 需专用硬件

核心模态详解

RGB-basedSkeleton-based 是两条最成熟的路线,参数对比如下:

维度RGB-basedSkeleton-based
参数量2M - 1B1.4M - 3.5M
前置依赖需要姿态估计模型
优势信息完整,无需前置模型极轻量,对背景和外观变化鲁棒
劣势计算量大,易受背景干扰姿态估计错误会传播到下游

猫科骨架路线的隐藏成本

人体骨架模型(COCO-17 或 NTU-25)不能直接用于猫——猫是四足动物,关节拓扑完全不同(AP-10K 定义 22 个关键点,包含尾巴和耳朵)。选择骨架路线意味着需要先训练一个猫科姿态估计器,或使用 SuperAnimal(见下文)做零样本替代。这个前置成本不可忽视。

RGB-D / 单目深度:无需额外硬件的第三条路线

RGB-D 动作识别是除 RGB 和骨架外最成熟的模态。2024-2025 年的关键进展是不再需要深度传感器——单目深度估计模型可以从普通 RGB 视频生成 depth map:

方法来源核心思路对猫场景的价值
DEARECCV 2024 Workshop单目深度估计 → RGB/Depth 双流融合无需额外硬件,增加深度信息作为补充模态
MAGNetNature Sci Rep 2026多模态自适应图卷积 + 跨模态自注意力模态缺失时自适应调整权重,鲁棒性好

DEAR 的方案特别适合边缘场景:用轻量单目深度估计模型(如 MiDaS-small)生成 depth map,与 RGB 分支并行编码后融合。对遮挡和背景干扰更鲁棒,且硬件成本不变

单目深度在动物上的局限

单目深度估计模型通常在人体/室内场景上训练,在动物(尤其是毛茸茸的猫)上的深度精度会下降。但作为辅助模态而非主模态,这种精度损失是可以接受的——深度分支提供的是相对几何关系,不需要绝对精确。

稀疏轨迹(TrAction):2026 年的新方向

TrAction(2026.06)提出了一种全新的输入表示:用 CoTracker3 提取稀疏点轨迹,替代密集 RGB 视频:

  • 输入仅为运动轨迹(2.5D 坐标序列),不含任何外观信息
  • 数据量仅为密集 RGB 的一小部分
  • 在 Something-Something V2 上达到 45% Top-1,EPIC-Kitchens-100 上 54%
  • 与 DINOv2 融合后 SSV2 精度提升 8.7 个点

这个思路对猫咪行为识别很有启发性:猫的行为很大程度上由运动模式决定(走、跑、跳、舔毛),外观信息反而不是最关键的。稀疏轨迹提供了一种纯运动驱动的轻量输入表示,且天然对背景变化、光照变化鲁棒。

其他探索方向

本节只点出路线与代表方法。完整的非视觉模态全景表、TrAction/DEAR/3DInAction 深度解读、端侧部署决策矩阵等详见姊妹篇《宠物动作识别(五):非视觉模态全景》。

模态现状猫场景可行性
3D 点云3DInAction (2023)、Motion PointNet 已有论文,但需深度传感器或多视角重建数据获取成本过高,短期不实用
3D Mesh3DMesh-GAR (2022) 从 RGB 回归人体 mesh 再做行为识别类比可用 SMAL 动物模型,但单目 3D 动物重建本身是难题
3D/4D Gaussian Splatting4DGS (CVPR 2024)、Director (2026) 聚焦动态场景渲染和语义理解,尚无行为识别应用从 4DGS 形变场提取运动特征是可行研究方向,但尚无先例
事件相机POKER (CVPR 2026)、Few-shot EAR (2025),μs 级延迟、极低功耗边缘部署极度友好,但需专用硬件,静态行为(趴/睡)几乎无信号
热成像动物领域主要用于检测和体温监测,行为分类研究极少可作为辅助传感器(体温异常检测),单独做行为识别不成熟

关键论文精读

以下对三条新模态路线中最具代表性的论文进行精读,提取可直接指导项目选型的关键信息。

📄 DEAR: Depth-Enhanced Action Recognition(ECCV 2024 Workshop)

作者:Rahmani et al., University of Surrey
代码GitHub

核心问题:2D RGB 在杂乱场景中难以区分动作,人类视觉依赖 3D 深度信息来理解空间关系,但深度传感器不普及。

方法:三编码分支 + 晚期融合

  • RGB 分支:Side4Video(S4V),用冻结的 CLIP ViT-B/16 + 并行可训练侧支提取空间特征
  • Depth 分支 1:同样的 S4V 架构处理 MiDaS 生成的 depth map
  • Depth 分支 2:VideoMamba 处理 depth map(Mamba 对稀疏深度特征有不同感知力)
  • 融合:Gated Cross-Attention(GCA)双向融合 RGB↔Depth 特征,最后对两路 score 取平均

关键结果(Something-Something V2)

配置Top-1提升
S4V(RGB only,作者复现)70.2%baseline
RGB + Depth(S4V)70.3%+0.1
RGB + Depth(VideoMamba)70.0%-0.2
RGB + Depth(S4V + VideoMamba)70.8%+0.6

类别级分析:深度信息对特定动作提升显著——"Stuffing something into something" +10%(63%→73%),"Dropping something onto something" +5%,"Pushing something so that it almost falls" +5%。这些动作都涉及物体间的空间关系

对猫咪项目的启示

  • 无需额外硬件——MiDaS 从 RGB 生成 depth map,硬件成本不变
  • 架构可借鉴——双流 + GCA 融合是通用模式,可替换 backbone 为 X3D-M
  • ⚠️ 提升幅度有限——整体 +0.6%,但对涉及空间关系的动作(猫跳上/跳下、钻进盒子)提升可能更大
  • ⚠️ VideoMamba 分支增加复杂度——边缘部署时可能只需 RGB+Depth(S4V) 两分支

📄 TrAction: Action Recognition with Sparse Trajectories(arXiv 2026.06)

作者:Meier et al., University of Göttingen / Max Planck Institute
代码GitHub

核心问题:密集 RGB 视频模型存在两大缺陷——(1) 内存和计算随分辨率/时长线性膨胀;(2) 强烈的外观偏差(appearance bias),模型倾向于从物体/背景推断动作而非运动本身。

方法:纯运动驱动的稀疏轨迹表示

  • 轨迹提取:CoTracker3 跟踪稀疏 2D 点(数百个),跨帧维持 identity 和遮挡推理
  • 2.5D 增强:用单目深度估计为每个轨迹点添加深度坐标,得到 (x, y, z, t) 序列
  • 轨迹 Transformer:简单 transformer 架构,直接在轨迹序列上操作
  • Masked-Trajectory Pretraining:类比 MAE 的掩码预训练,随机遮蔽部分轨迹点后重建,下游分类提升 ~5 个点

关键结果

配置SSV2 Top-1EK100 Top-1备注
TrAction(纯轨迹)45%54%仅运动信息,无外观
TrAction + DINOv2 融合45% + 8.7轨迹与外观互补
TrAction + V-JEPA 2 融合45% + 1.6与视频基础模型互补

关键发现:轨迹特征与外观特征高度互补——在运动判别性强的子集上(外观模型最弱的地方),轨迹带来的提升最大。在 Chirality-in-Action benchmark(时间反转敏感性测试)上,纯轨迹方法超过 V-JEPA

对猫咪项目的启示

  • 天然适配猫咪场景——猫的行为(走/跑/跳/舔毛/抓挠)主要由运动模式区分,外观信息冗余度高
  • 数据量极小——数百个点的轨迹 vs 密集 RGB 帧,存储和传输成本大幅降低
  • 对背景/光照鲁棒——轨迹不含外观信息,不受猫毛色变化、环境光照影响
  • ⚠️ CoTracker3 本身有计算开销——轨迹提取阶段需要运行跟踪模型,端到端延迟需评估
  • ⚠️ 静态行为无效——猫趴着/睡觉时几乎无轨迹信号,需与 RGB 分支互补
  • ⚠️ 动物轨迹跟踪未验证——CoTracker3 在人体场景上训练,猫体跟踪质量需实测

📄 3DInAction: Understanding Human Actions in 3D Point Clouds(arXiv 2023)

作者:Ben-Shabat et al., ANU / Technion
代码GitHub

核心问题:3D 点云序列的动作识别长期被忽视——点云无结构、无序、点数可变,且帧间无点对点映射,时空表征学习困难。

方法:t-patch + 分层架构

  • t-patch(时序点块):在时间窗口内对局部点区域进行分组,捕捉局部表面形变和运动
  • 分层 MLP 架构:逐层聚合 t-patch 特征,从局部到全局构建时空表征
  • 逐帧预测:不同于大多数方法的 clip-level 分类,3DInAction 输出每帧的动作标签
  • 无需先验:不依赖骨架提取或人体检测,是通用的 3D 动作识别方法

关键结果

数据集3DInAction此前 SOTA提升
DFAUST(4D 人体扫描,14 类动作)+13%
IKEA ASM(家具装配,33 类动作)+7%

相关进展:2025 年的 "Human Action Recognition from Point Clouds over Time" 进一步扩展了这条路线——支持单目深度估计生成的点云(不依赖深度传感器),结合稀疏卷积 + 点嵌入的 backbone,在 NTU RGB-D 120 上达到 89.3%(传感器 + 估计点云集成),与骨架方法竞争力相当。

对猫咪项目的启示

  • ⚠️ 数据获取是最大瓶颈——需要深度传感器(Kinect/LiDAR)或多视角重建,远超普通监控摄像头的成本
  • ⚠️ 单目估计点云质量存疑——2025 年论文虽支持估计点云,但在人体场景上验证,猫的毛发表面会导致深度估计严重退化
  • 逐帧预测有价值——猫咪行为监控需要实时事件检测,clip-level 分类延迟过高
  • 无需骨架先验——对四足动物友好,不需要定义猫的关节拓扑
论文精读小结:三条新模态路线中,DEAR(RGB-D 融合)的工程可行性最高——无需额外硬件,架构可复用;TrAction(稀疏轨迹)最具创新性,纯运动驱动的特性与猫咪场景高度契合,但 CoTracker3 在动物上的表现需验证;3D 点云路线学术价值高但工程成本过大,短期不适合边缘监控场景。
mmaction2 模型库
OpenMMLab 生态覆盖了什么

mmaction2 是动作识别领域的 MMDetection——一个框架覆盖了 25+ 识别模型、5+ 检测模型和 5+ 骨架模型,统一在模块化的 config 体系下。

精度效率全览(Kinetics-400 Top-1 排序)

模型路线K400 Top-1参数量FLOPs边缘友好
VideoMAE V2 ViT-G掩码预训练90.0%~1B~3T不可
UniFormer V2-LTransformer89.6%354M1.3T不可
VideoMAE V1 ViT-B掩码预训练81.3%87M180G不可
UniFormer V1-STransformer80.9%21.4M41.8G中等
CSN-R503D CNN79.4%13.1M55.9G中等
SlowFast-R50 8×83D CNN76.8%34.5M66.1G中等
TSM-R50 16帧2D CNN75.1%23.9M65.8G中等
X3D-M3D CNN76.4%2.6M2.7G优秀
X3D-S3D CNN73.2%2.0M0.6G优秀
TSM-MobileNetV22D CNN68.7%2.7M3.3G优秀

骨架方法:参数量碾压级优势

骨架方法的参数量比 RGB 方法小一到两个数量级,精度却毫不逊色(在 NTU-RGB+D 上):

模型NTU60-XSub Top-1参数量FLOPs备注
STGCN++92.77%(4-stream)1.39M1.95G骨架最轻量基线
ST-GCN92.34%(4-stream)3.1M3.8G经典图卷积
PoseC3D94.0%(Fusion)3.2M20.6G骨架热力图 + 3D CNN
关键发现:如果猫科姿态估计问题能解决,骨架路线是边缘部署的最优选择——STGCN++ 仅 1.39M 参数就能达到 92.77% 精度。但正如前面警告所述,猫的骨架拓扑与人不同,需要额外的姿态估计前端。

mmaction2 的部署工具链

mmaction2 通过 MMDeploy 支持主流推理后端:

部署后端适用平台量化支持3D Conv 支持
TensorRTNVIDIA Jetson / GPUINT8 PTQ + QAT良好
ONNX Runtime跨平台INT8 动态量化良好
NCNNARM 移动端 / 嵌入式INT8 量化有限
RKNN瑞芯微 NPU(RV11xx)INT8 量化需验证
OpenVINOIntel VPU / CPUINT8 量化良好
2023-2026 新架构
mmaction2 之外发生了什么

mmaction2 最新版本(v1.2.0, 2023.10)的覆盖边界大约到 VideoMAE V1 和 UniFormer V1。但此后两年有大量重要工作涌现。

SSM 路线:VideoMamba 系列

模型会议K400 Top-1核心创新参数量
VideoMambaECCV 202485.0%(M)纯 SSM 视频 backbone,线性复杂度Ti 7M / S 26M / M 66M
VideoMambaProICCV 202591.9%(M)修复 Mamba 稀疏 token 遗忘 + 全局注意力补偿~66M
ETMamba202588.3%时空特征保持 + 双向共享 SSM中等

SSM 部署瓶颈

Mamba 的选择性扫描(selective scan)算子目前在 TensorRT / NCNN / RKNN 上均无原生支持。VideoMamba-Ti(7M 参数)满足参数量约束,但 算子兼容性是当前最大障碍。短期不建议作为边缘部署首选,但值得作为技术储备持续关注。

掩码预训练的规模化:VideoMAE V2 → InternVideo2

掩码视频建模(MVM)已成为视频预训练的标准范式。关键发现:极高掩码比例(90-95%)对视频有效,因为视频数据的时间冗余极高。

模型会议K400 Top-1参数量对项目的价值
VideoMAE V2 ViT-GCVPR 202390.0%~1B提供预训练权重供知识蒸馏
VideoMAE V2 ViT-SCVPR 202383.6%22M蒸馏小模型,边缘部署候选
InternVideo2ECCV 2024SOTA(60+ 任务)6B视频基础模型,仅作教师模型

边缘部署专用方法

2024-2025 年出现了专门为边缘设备设计的方法:

方法会议核心创新边缘效果
EdgeOARIEEE TMC 2025Early Exit + 特征增强延迟降低 97%+
TinyActPLOS ONE 2025边缘-云协同 + 知识蒸馏极轻量学生模型
Hybrid KDMDPI 2025三层蒸馏(响应+注意力+特征)UCF101:92.07%(教师 94.74%)
知识蒸馏是连接 SOTA 精度与边缘效率的桥梁。典型管线:大型教师模型(VideoMAE V2)→ 中型学生模型(X3D-M 大小)→ 边缘部署。多层级蒸馏可将精度差距控制在 2-4% 以内。
动物行为识别
动物动作检测领域做了什么

动物行为识别是计算机视觉中一个快速成长但相对小众的分支,面临三个结构性瓶颈:数据匮乏、长尾分布严重、骨架定义不统一。

数据集章节已迁移

完整的数据集汇总(18 个数据源)、人类→动物迁移分析、行为重叠对比和 17 项缺口分析已迁移到数据集全景汇总与缺口分析专篇。本文保留模型维度的选型分析。

人类→动物迁移:能复用多少?

从 Kinetics-400(人类动作)预训练迁移到动物行为,MammalNet 报告了 +10.1% 的 per-class 准确率提升(27.7% → 37.8%,MViT v2)#Chen et al., 2023。证明特征级迁移有效

但骨架级别无法直接迁移——人体 COCO-17 骨架(17 关键点,双臂双腿直立拓扑)与猫科 AP-10K 骨架(22 关键点,四足+尾+耳拓扑)完全不同,同名关键点语义也不同。

SuperAnimal:零样本猫科姿态估计

SuperAnimal(Nature Communications 2024, EPFL)覆盖 45+ 物种,27-39 关键点,零样本可用,已集成到 DeepLabCut Model Zoo。

对项目的价值:SuperAnimal 可以直接用于猫咪视频获取骨架,省去大量姿态标注成本。如果选择骨架路线,这解决了前置姿态估计问题。
综合选型
500 元 BOM 约束下的选型决策

硬件约束分析

500 元 BOM 意味着端侧 SoC 大概率是瑞芯微 RV11xx / H28xx 级别,NPU 算力 0.5-1.0 TOPS。推理预算:

  • 单次推理 FLOPs 应控制在 1-5G 以内(30fps 实时)
  • 参数量 10M 以内 为佳
  • NPU 对标准 Conv2D / DepthwiseConv 支持最好,3D Conv 支持有限,Transformer 注意力 / SSM 扫描需特殊处理

推荐方案矩阵

方案模型参数量FLOPsK400 精度部署难度推荐度
A:RGB 轻量 3D CNN X3D-M 2.6M 2.7G 76.4% ★★☆ ⭐⭐⭐⭐
B:RGB 轻量 2D CNN TSM + MobileNetV2 2.7M 3.3G 68.7% ★☆☆ ⭐⭐⭐⭐
C:检测 + 分类 YOLOv8 + 动作分类头 ~10M ★★☆ ⭐⭐⭐⭐⭐
D:骨架路线 SuperAnimal + STGCN++ ~5M(总计) < 5G —(NTU60: 92.8%) ★★★★ ⭐⭐⭐
E:ViT 蒸馏 VideoMAE V2 ViT-S 蒸馏 22M 57G 83.6% ★★★ ⭐⭐⭐

推荐技术架构

综合数据可用性、部署约束和精度需求,推荐的分层架构如下:

flowchart TD
  VIDEO["视频流"] --> DETECT["Layer 1: 检测+跟踪\nYOLOv8/v11 猫检测\n+ ByteTrack 跟踪"]
  DETECT --> POSE["Layer 2: 姿态估计\nSuperAnimal 零样本\n(可选)"]
  DETECT --> COMMON["Layer 3a: 常见行为分类\nX3D-M 或 TSM+MobileNetV2\n从 Animal Kingdom 迁移"]
  POSE --> COMMON
  DETECT --> ABNORMAL["Layer 3b: 异常行为检测\nVideoMAE 重建误差\n(anomaly detection)"]
  COMMON --> AGG["Layer 4: 时序聚合\n滑动窗口 + 规则引擎"]
  ABNORMAL --> AGG
  AGG --> OUTPUT["结构化事件输出"]
  

分层策略的理由

  • 常见行为(走/跑/跳/进食/舔毛)在 Animal Kingdom 和 MammalNet 中有数据,可以用 X3D-M 做 fine-tune,路线清晰
  • 异常行为(呕吐/抽搐)无公开数据,走 anomaly detection 范式更实际——不要求精确分类,而是检测"不正常"的帧,再上报云端
  • 姿态估计是可选层:如果骨架路线验证效果好,SuperAnimal + STGCN++ 可以作为轻量替代方案

分阶段实施路径

阶段目标模型数据
Phase 1(当前)建立 baselineX3D-M zero-shot + fine-tuneAnimal Kingdom 猫科子集 + 自标少量
Phase 2精度提升VideoMAE V2 预训练 → 蒸馏到 X3D-MAnimal Kingdom + MammalNet + 合成
Phase 3端侧部署INT8 量化 + RKNN 适配真实监控场景视频
Phase 4(探索)架构升级VideoMamba-Ti(待 SSM 部署成熟)混合数据
总结
关键判断与下一步

五个核心判断

  • RGB 路线优先于骨架路线:猫科姿态估计虽有 SuperAnimal 兜底,但整体 pipeline 复杂度更高。X3D-M(2.6M / 2.7G FLOPs)是 RGB 方案的首选起点
  • 常见行为技术路线已清晰:从 Animal Kingdom 猫科子集迁移 + X3D-M fine-tune,有数据有模型有 benchmark
  • 异常行为是真正的难题:呕吐/抽搐在所有公开数据中完全空白,anomaly detection 范式 + 合成数据是两条可行路径
  • 知识蒸馏是精度与效率的桥梁:VideoMAE V2 预训练权重 → X3D-M 学生模型,典型精度损失 2-4%
  • SSM 部署还不成熟:VideoMamba 精度优秀但选择性扫描算子缺乏 NPU 支持,作为技术储备持续关注
  • 输入模态在扩展:RGB-D(单目深度)和稀疏轨迹是两条值得关注的新路线——前者无需额外硬件即可增加深度信息,后者提供纯运动驱动的轻量表示,两者都对猫咪场景有适配潜力

下一步行动项

  1. 搭建 X3D-M baseline:在 mmaction2 中加载 X3D-M 预训练权重,用 Animal Kingdom 猫科子集做 fine-tune,建立常见行为的 zero-shot 和 fine-tune 两个 baseline
  2. 精读 PMTNet(2026):目前唯一专门做猫咪行为识别的论文,其部件级建模思路(body/head/tail 检测 → 时序建模)值得深入分析
  3. 验证 SuperAnimal:在真实猫咪视频上跑 SuperAnimal 零样本姿态估计,评估骨架质量和下游行为分类可行性
  4. 探索 RGB-D 融合:用 MiDaS-small 从猫咪视频生成 depth map,验证 DEAR 式双流融合是否带来精度提升
  5. 启动任务 2 和任务 3:数据集搜集已在本文覆盖,Benchmark 搭建可以基于本文的选型建议直接启动
References
参考文献与开源仓库

框架与工具

  • OpenMMLab/mmaction2 — 动作识别工具箱. GitHub
  • OpenMMLab/mmdeploy — 统一部署框架. GitHub

新架构论文

  • Li, K. et al. (2024). VideoMamba: State Space Model for Efficient Video Understanding. ECCV 2024. GitHub
  • VideoMambaPro: Snakes and Ladders. ICCV 2025. arXiv
  • Tong, Z. et al. (2023). VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking. CVPR 2023. GitHub
  • InternVideo2: Scaling Foundation Models for Multimodal Video Understanding. ECCV 2024. GitHub
  • SkateFormer: Skeletal-Temporal Transformer for Human Action Recognition. ECCV 2024. GitHub

动物行为数据集与方法

  • Xu, C. et al. (2022). Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding. CVPR 2022 Oral. GitHub
  • MammalNet: A Large-Scale Video Benchmark for Mammal Behavior Understanding. CVPR 2023. GitHub
  • SuperAnimal: Pretrained deep learning models for animal pose tracking. Nature Communications, 2024. DeepLabCut
  • PMTNet: Cat Behavior Recognition via Part-level Temporal Modeling. Animals (MDPI), 2026.
  • Yu, T. et al. (2021). AP-10K: A Benchmark for Animal Pose Estimation. NeurIPS 2021. GitHub

边缘部署

  • EdgeOAR: Real-time Online Action Recognition On Edge Devices. IEEE TMC, 2025.
  • TinyAct: Edge-Cloud Collaborative Action Recognition via Knowledge Distillation. PLOS ONE, 2025.

其他输入模态

  • Rahmani, S. et al. (2024). DEAR: Depth-Estimated Action Recognition. ECCV 2024 Workshop. Project
  • MAGNet: Enhancing Action Recognition with Multimodal Fusion and Adaptive Graph Convolution. Nature Scientific Reports, 2026.
  • TrAction: Action Recognition with Sparse Trajectories. arXiv:2606.03490, 2026. GitHub
  • 3DInAction: Understanding Human Actions in 3D Point Clouds. arXiv:2303.06346, 2023.
  • Cao, M. et al. (2026). Seeing Motion Through Polarity for Event-based Action Recognition. CVPR 2026.
  • Wu, G. et al. (2024). 4D Gaussian Splatting for Real-Time Dynamic Scene Rendering. CVPR 2024. GitHub
  • A Comprehensive Survey on RGB-D-based Human Action Recognition. Springer JIVP, 2025.