动作检测模型全景
第一阶段任务规划 中我们定义了三条任务线,本文是任务 1(现有模型调研与方法总结)的交付物。
核心问题只有一个:现有动作检测模型在动物(尤其是猫)行为识别上能做到什么程度? 要回答这个问题,需要同时摸清三个层面:
- mmaction2 工具链里有什么——这是验证的第一站,OpenMMLab 生态覆盖了 2014-2023 年的主流模型
- 2023-2026 年冒出了什么新东西——VideoMamba、VideoMAE V2、视频基础模型,mmaction2 还没来得及收录
- 动物行为识别领域已经做了什么——数据集、方法、跨物种迁移的可行性
动作识别的架构演进可以归纳为三波浪潮,每一波都在解决前一波的核心瓶颈:
flowchart LR
subgraph CNN["第一波:CNN 时代"]
direction TB
C1["2D CNN
TSN/TSM
轻量但无显式运动建模"]
C2["3D CNN
I3D/SlowFast/X3D
显式时空建模但计算量大"]
end
subgraph TR["第二波:Transformer 时代"]
direction TB
T1["Video Transformer
TimeSformer/MViT/UniFormer
长程依赖建模但 O(N²)"]
T2["掩码预训练
VideoMAE/V2
自监督+规模化的胜利"]
end
subgraph SM["第三波:SSM 时代"]
direction TB
S1["Video Mamba
线性复杂度
长序列优势"]
S2["混合架构
SSM + Attention
互补补偿"]
end
CNN --> TR --> SM
输入模态全景:从 RGB 到稀疏轨迹
与架构演进正交的是输入模态的选择。传统上动作识别主要依赖 RGB 和骨架两条路线,但 2024-2026 年出现了多种新的输入表示:
| 模态 | 代表方法 | 输入形式 | 计算量 | 猫场景适配 |
|---|---|---|---|---|
| RGB | SlowFast, X3D, VideoMamba, VideoMAE | 原始视频帧 | 大(GB 级 FLOPs) | 首选 — 信息完整 |
| Skeleton | ST-GCN, PoseC3D, SkateFormer | 关键点序列 | 极小 | 需猫姿态估计 |
| RGB-D / Depth | DEAR, MAGNet | RGB + 深度图 | 中(双流) | 可行 — 单目估计即可 |
| 稀疏轨迹 | TrAction (2026) | CoTracker3 点轨迹 | 低 | 潜力 — 纯运动驱动 |
| 3D 点云 | 3DInAction, Motion PointNet | 点云序列 | 中-高 | 困难 — 需深度传感器 |
| 事件相机 | POKER (CVPR 2026) | 异步事件流 | 极低 | 不成熟 — 需专用硬件 |
核心模态详解
RGB-based 和 Skeleton-based 是两条最成熟的路线,参数对比如下:
| 维度 | RGB-based | Skeleton-based |
|---|---|---|
| 参数量 | 2M - 1B | 1.4M - 3.5M |
| 前置依赖 | 无 | 需要姿态估计模型 |
| 优势 | 信息完整,无需前置模型 | 极轻量,对背景和外观变化鲁棒 |
| 劣势 | 计算量大,易受背景干扰 | 姿态估计错误会传播到下游 |
猫科骨架路线的隐藏成本
人体骨架模型(COCO-17 或 NTU-25)不能直接用于猫——猫是四足动物,关节拓扑完全不同(AP-10K 定义 22 个关键点,包含尾巴和耳朵)。选择骨架路线意味着需要先训练一个猫科姿态估计器,或使用 SuperAnimal(见下文)做零样本替代。这个前置成本不可忽视。
RGB-D / 单目深度:无需额外硬件的第三条路线
RGB-D 动作识别是除 RGB 和骨架外最成熟的模态。2024-2025 年的关键进展是不再需要深度传感器——单目深度估计模型可以从普通 RGB 视频生成 depth map:
| 方法 | 来源 | 核心思路 | 对猫场景的价值 |
|---|---|---|---|
| DEAR | ECCV 2024 Workshop | 单目深度估计 → RGB/Depth 双流融合 | 无需额外硬件,增加深度信息作为补充模态 |
| MAGNet | Nature Sci Rep 2026 | 多模态自适应图卷积 + 跨模态自注意力 | 模态缺失时自适应调整权重,鲁棒性好 |
DEAR 的方案特别适合边缘场景:用轻量单目深度估计模型(如 MiDaS-small)生成 depth map,与 RGB 分支并行编码后融合。对遮挡和背景干扰更鲁棒,且硬件成本不变。
单目深度在动物上的局限
单目深度估计模型通常在人体/室内场景上训练,在动物(尤其是毛茸茸的猫)上的深度精度会下降。但作为辅助模态而非主模态,这种精度损失是可以接受的——深度分支提供的是相对几何关系,不需要绝对精确。
稀疏轨迹(TrAction):2026 年的新方向
TrAction(2026.06)提出了一种全新的输入表示:用 CoTracker3 提取稀疏点轨迹,替代密集 RGB 视频:
- 输入仅为运动轨迹(2.5D 坐标序列),不含任何外观信息
- 数据量仅为密集 RGB 的一小部分
- 在 Something-Something V2 上达到 45% Top-1,EPIC-Kitchens-100 上 54%
- 与 DINOv2 融合后 SSV2 精度提升 8.7 个点
这个思路对猫咪行为识别很有启发性:猫的行为很大程度上由运动模式决定(走、跑、跳、舔毛),外观信息反而不是最关键的。稀疏轨迹提供了一种纯运动驱动的轻量输入表示,且天然对背景变化、光照变化鲁棒。
其他探索方向
本节只点出路线与代表方法。完整的非视觉模态全景表、TrAction/DEAR/3DInAction 深度解读、端侧部署决策矩阵等详见姊妹篇《宠物动作识别(五):非视觉模态全景》。
| 模态 | 现状 | 猫场景可行性 |
|---|---|---|
| 3D 点云 | 3DInAction (2023)、Motion PointNet 已有论文,但需深度传感器或多视角重建 | 数据获取成本过高,短期不实用 |
| 3D Mesh | 3DMesh-GAR (2022) 从 RGB 回归人体 mesh 再做行为识别 | 类比可用 SMAL 动物模型,但单目 3D 动物重建本身是难题 |
| 3D/4D Gaussian Splatting | 4DGS (CVPR 2024)、Director (2026) 聚焦动态场景渲染和语义理解,尚无行为识别应用 | 从 4DGS 形变场提取运动特征是可行研究方向,但尚无先例 |
| 事件相机 | POKER (CVPR 2026)、Few-shot EAR (2025),μs 级延迟、极低功耗 | 边缘部署极度友好,但需专用硬件,静态行为(趴/睡)几乎无信号 |
| 热成像 | 动物领域主要用于检测和体温监测,行为分类研究极少 | 可作为辅助传感器(体温异常检测),单独做行为识别不成熟 |
关键论文精读
以下对三条新模态路线中最具代表性的论文进行精读,提取可直接指导项目选型的关键信息。
📄 DEAR: Depth-Enhanced Action Recognition(ECCV 2024 Workshop)
作者:Rahmani et al., University of Surrey
代码:GitHub
核心问题:2D RGB 在杂乱场景中难以区分动作,人类视觉依赖 3D 深度信息来理解空间关系,但深度传感器不普及。
方法:三编码分支 + 晚期融合
- RGB 分支:Side4Video(S4V),用冻结的 CLIP ViT-B/16 + 并行可训练侧支提取空间特征
- Depth 分支 1:同样的 S4V 架构处理 MiDaS 生成的 depth map
- Depth 分支 2:VideoMamba 处理 depth map(Mamba 对稀疏深度特征有不同感知力)
- 融合:Gated Cross-Attention(GCA)双向融合 RGB↔Depth 特征,最后对两路 score 取平均
关键结果(Something-Something V2):
| 配置 | Top-1 | 提升 |
|---|---|---|
| S4V(RGB only,作者复现) | 70.2% | baseline |
| RGB + Depth(S4V) | 70.3% | +0.1 |
| RGB + Depth(VideoMamba) | 70.0% | -0.2 |
| RGB + Depth(S4V + VideoMamba) | 70.8% | +0.6 |
类别级分析:深度信息对特定动作提升显著——"Stuffing something into something" +10%(63%→73%),"Dropping something onto something" +5%,"Pushing something so that it almost falls" +5%。这些动作都涉及物体间的空间关系。
对猫咪项目的启示:
- ✅ 无需额外硬件——MiDaS 从 RGB 生成 depth map,硬件成本不变
- ✅ 架构可借鉴——双流 + GCA 融合是通用模式,可替换 backbone 为 X3D-M
- ⚠️ 提升幅度有限——整体 +0.6%,但对涉及空间关系的动作(猫跳上/跳下、钻进盒子)提升可能更大
- ⚠️ VideoMamba 分支增加复杂度——边缘部署时可能只需 RGB+Depth(S4V) 两分支
📄 TrAction: Action Recognition with Sparse Trajectories(arXiv 2026.06)
作者:Meier et al., University of Göttingen / Max Planck Institute
代码:GitHub
核心问题:密集 RGB 视频模型存在两大缺陷——(1) 内存和计算随分辨率/时长线性膨胀;(2) 强烈的外观偏差(appearance bias),模型倾向于从物体/背景推断动作而非运动本身。
方法:纯运动驱动的稀疏轨迹表示
- 轨迹提取:CoTracker3 跟踪稀疏 2D 点(数百个),跨帧维持 identity 和遮挡推理
- 2.5D 增强:用单目深度估计为每个轨迹点添加深度坐标,得到 (x, y, z, t) 序列
- 轨迹 Transformer:简单 transformer 架构,直接在轨迹序列上操作
- Masked-Trajectory Pretraining:类比 MAE 的掩码预训练,随机遮蔽部分轨迹点后重建,下游分类提升 ~5 个点
关键结果:
| 配置 | SSV2 Top-1 | EK100 Top-1 | 备注 |
|---|---|---|---|
| TrAction(纯轨迹) | 45% | 54% | 仅运动信息,无外观 |
| TrAction + DINOv2 融合 | 45% + 8.7 | — | 轨迹与外观互补 |
| TrAction + V-JEPA 2 融合 | 45% + 1.6 | — | 与视频基础模型互补 |
关键发现:轨迹特征与外观特征高度互补——在运动判别性强的子集上(外观模型最弱的地方),轨迹带来的提升最大。在 Chirality-in-Action benchmark(时间反转敏感性测试)上,纯轨迹方法超过 V-JEPA。
对猫咪项目的启示:
- ✅ 天然适配猫咪场景——猫的行为(走/跑/跳/舔毛/抓挠)主要由运动模式区分,外观信息冗余度高
- ✅ 数据量极小——数百个点的轨迹 vs 密集 RGB 帧,存储和传输成本大幅降低
- ✅ 对背景/光照鲁棒——轨迹不含外观信息,不受猫毛色变化、环境光照影响
- ⚠️ CoTracker3 本身有计算开销——轨迹提取阶段需要运行跟踪模型,端到端延迟需评估
- ⚠️ 静态行为无效——猫趴着/睡觉时几乎无轨迹信号,需与 RGB 分支互补
- ⚠️ 动物轨迹跟踪未验证——CoTracker3 在人体场景上训练,猫体跟踪质量需实测
📄 3DInAction: Understanding Human Actions in 3D Point Clouds(arXiv 2023)
作者:Ben-Shabat et al., ANU / Technion
代码:GitHub
核心问题:3D 点云序列的动作识别长期被忽视——点云无结构、无序、点数可变,且帧间无点对点映射,时空表征学习困难。
方法:t-patch + 分层架构
- t-patch(时序点块):在时间窗口内对局部点区域进行分组,捕捉局部表面形变和运动
- 分层 MLP 架构:逐层聚合 t-patch 特征,从局部到全局构建时空表征
- 逐帧预测:不同于大多数方法的 clip-level 分类,3DInAction 输出每帧的动作标签
- 无需先验:不依赖骨架提取或人体检测,是通用的 3D 动作识别方法
关键结果:
| 数据集 | 3DInAction | 此前 SOTA | 提升 |
|---|---|---|---|
| DFAUST(4D 人体扫描,14 类动作) | — | — | +13% |
| IKEA ASM(家具装配,33 类动作) | — | — | +7% |
相关进展:2025 年的 "Human Action Recognition from Point Clouds over Time" 进一步扩展了这条路线——支持单目深度估计生成的点云(不依赖深度传感器),结合稀疏卷积 + 点嵌入的 backbone,在 NTU RGB-D 120 上达到 89.3%(传感器 + 估计点云集成),与骨架方法竞争力相当。
对猫咪项目的启示:
- ⚠️ 数据获取是最大瓶颈——需要深度传感器(Kinect/LiDAR)或多视角重建,远超普通监控摄像头的成本
- ⚠️ 单目估计点云质量存疑——2025 年论文虽支持估计点云,但在人体场景上验证,猫的毛发表面会导致深度估计严重退化
- ✅ 逐帧预测有价值——猫咪行为监控需要实时事件检测,clip-level 分类延迟过高
- ✅ 无需骨架先验——对四足动物友好,不需要定义猫的关节拓扑
mmaction2 是动作识别领域的 MMDetection——一个框架覆盖了 25+ 识别模型、5+ 检测模型和 5+ 骨架模型,统一在模块化的 config 体系下。
精度效率全览(Kinetics-400 Top-1 排序)
| 模型 | 路线 | K400 Top-1 | 参数量 | FLOPs | 边缘友好 |
|---|---|---|---|---|---|
| VideoMAE V2 ViT-G | 掩码预训练 | 90.0% | ~1B | ~3T | 不可 |
| UniFormer V2-L | Transformer | 89.6% | 354M | 1.3T | 不可 |
| VideoMAE V1 ViT-B | 掩码预训练 | 81.3% | 87M | 180G | 不可 |
| UniFormer V1-S | Transformer | 80.9% | 21.4M | 41.8G | 中等 |
| CSN-R50 | 3D CNN | 79.4% | 13.1M | 55.9G | 中等 |
| SlowFast-R50 8×8 | 3D CNN | 76.8% | 34.5M | 66.1G | 中等 |
| TSM-R50 16帧 | 2D CNN | 75.1% | 23.9M | 65.8G | 中等 |
| X3D-M | 3D CNN | 76.4% | 2.6M | 2.7G | 优秀 |
| X3D-S | 3D CNN | 73.2% | 2.0M | 0.6G | 优秀 |
| TSM-MobileNetV2 | 2D CNN | 68.7% | 2.7M | 3.3G | 优秀 |
骨架方法:参数量碾压级优势
骨架方法的参数量比 RGB 方法小一到两个数量级,精度却毫不逊色(在 NTU-RGB+D 上):
| 模型 | NTU60-XSub Top-1 | 参数量 | FLOPs | 备注 |
|---|---|---|---|---|
| STGCN++ | 92.77%(4-stream) | 1.39M | 1.95G | 骨架最轻量基线 |
| ST-GCN | 92.34%(4-stream) | 3.1M | 3.8G | 经典图卷积 |
| PoseC3D | 94.0%(Fusion) | 3.2M | 20.6G | 骨架热力图 + 3D CNN |
mmaction2 的部署工具链
mmaction2 通过 MMDeploy 支持主流推理后端:
| 部署后端 | 适用平台 | 量化支持 | 3D Conv 支持 |
|---|---|---|---|
| TensorRT | NVIDIA Jetson / GPU | INT8 PTQ + QAT | 良好 |
| ONNX Runtime | 跨平台 | INT8 动态量化 | 良好 |
| NCNN | ARM 移动端 / 嵌入式 | INT8 量化 | 有限 |
| RKNN | 瑞芯微 NPU(RV11xx) | INT8 量化 | 需验证 |
| OpenVINO | Intel VPU / CPU | INT8 量化 | 良好 |
mmaction2 最新版本(v1.2.0, 2023.10)的覆盖边界大约到 VideoMAE V1 和 UniFormer V1。但此后两年有大量重要工作涌现。
SSM 路线:VideoMamba 系列
| 模型 | 会议 | K400 Top-1 | 核心创新 | 参数量 |
|---|---|---|---|---|
| VideoMamba | ECCV 2024 | 85.0%(M) | 纯 SSM 视频 backbone,线性复杂度 | Ti 7M / S 26M / M 66M |
| VideoMambaPro | ICCV 2025 | 91.9%(M) | 修复 Mamba 稀疏 token 遗忘 + 全局注意力补偿 | ~66M |
| ETMamba | 2025 | 88.3% | 时空特征保持 + 双向共享 SSM | 中等 |
SSM 部署瓶颈
Mamba 的选择性扫描(selective scan)算子目前在 TensorRT / NCNN / RKNN 上均无原生支持。VideoMamba-Ti(7M 参数)满足参数量约束,但 算子兼容性是当前最大障碍。短期不建议作为边缘部署首选,但值得作为技术储备持续关注。
掩码预训练的规模化:VideoMAE V2 → InternVideo2
掩码视频建模(MVM)已成为视频预训练的标准范式。关键发现:极高掩码比例(90-95%)对视频有效,因为视频数据的时间冗余极高。
| 模型 | 会议 | K400 Top-1 | 参数量 | 对项目的价值 |
|---|---|---|---|---|
| VideoMAE V2 ViT-G | CVPR 2023 | 90.0% | ~1B | 提供预训练权重供知识蒸馏 |
| VideoMAE V2 ViT-S | CVPR 2023 | 83.6% | 22M | 蒸馏小模型,边缘部署候选 |
| InternVideo2 | ECCV 2024 | SOTA(60+ 任务) | 6B | 视频基础模型,仅作教师模型 |
边缘部署专用方法
2024-2025 年出现了专门为边缘设备设计的方法:
| 方法 | 会议 | 核心创新 | 边缘效果 |
|---|---|---|---|
| EdgeOAR | IEEE TMC 2025 | Early Exit + 特征增强 | 延迟降低 97%+ |
| TinyAct | PLOS ONE 2025 | 边缘-云协同 + 知识蒸馏 | 极轻量学生模型 |
| Hybrid KD | MDPI 2025 | 三层蒸馏(响应+注意力+特征) | UCF101:92.07%(教师 94.74%) |
动物行为识别是计算机视觉中一个快速成长但相对小众的分支,面临三个结构性瓶颈:数据匮乏、长尾分布严重、骨架定义不统一。
数据集章节已迁移
完整的数据集汇总(18 个数据源)、人类→动物迁移分析、行为重叠对比和 17 项缺口分析已迁移到数据集全景汇总与缺口分析专篇。本文保留模型维度的选型分析。
人类→动物迁移:能复用多少?
从 Kinetics-400(人类动作)预训练迁移到动物行为,MammalNet 报告了 +10.1% 的 per-class 准确率提升(27.7% → 37.8%,MViT v2)#Chen et al., 2023。证明特征级迁移有效。
但骨架级别无法直接迁移——人体 COCO-17 骨架(17 关键点,双臂双腿直立拓扑)与猫科 AP-10K 骨架(22 关键点,四足+尾+耳拓扑)完全不同,同名关键点语义也不同。
SuperAnimal:零样本猫科姿态估计
SuperAnimal(Nature Communications 2024, EPFL)覆盖 45+ 物种,27-39 关键点,零样本可用,已集成到 DeepLabCut Model Zoo。
硬件约束分析
500 元 BOM 意味着端侧 SoC 大概率是瑞芯微 RV11xx / H28xx 级别,NPU 算力 0.5-1.0 TOPS。推理预算:
- 单次推理 FLOPs 应控制在 1-5G 以内(30fps 实时)
- 参数量 10M 以内 为佳
- NPU 对标准 Conv2D / DepthwiseConv 支持最好,3D Conv 支持有限,Transformer 注意力 / SSM 扫描需特殊处理
推荐方案矩阵
| 方案 | 模型 | 参数量 | FLOPs | K400 精度 | 部署难度 | 推荐度 |
|---|---|---|---|---|---|---|
| A:RGB 轻量 3D CNN | X3D-M | 2.6M | 2.7G | 76.4% | ★★☆ | ⭐⭐⭐⭐ |
| B:RGB 轻量 2D CNN | TSM + MobileNetV2 | 2.7M | 3.3G | 68.7% | ★☆☆ | ⭐⭐⭐⭐ |
| C:检测 + 分类 | YOLOv8 + 动作分类头 | ~10M | 中 | — | ★★☆ | ⭐⭐⭐⭐⭐ |
| D:骨架路线 | SuperAnimal + STGCN++ | ~5M(总计) | < 5G | —(NTU60: 92.8%) | ★★★★ | ⭐⭐⭐ |
| E:ViT 蒸馏 | VideoMAE V2 ViT-S 蒸馏 | 22M | 57G | 83.6% | ★★★ | ⭐⭐⭐ |
推荐技术架构
综合数据可用性、部署约束和精度需求,推荐的分层架构如下:
flowchart TD VIDEO["视频流"] --> DETECT["Layer 1: 检测+跟踪\nYOLOv8/v11 猫检测\n+ ByteTrack 跟踪"] DETECT --> POSE["Layer 2: 姿态估计\nSuperAnimal 零样本\n(可选)"] DETECT --> COMMON["Layer 3a: 常见行为分类\nX3D-M 或 TSM+MobileNetV2\n从 Animal Kingdom 迁移"] POSE --> COMMON DETECT --> ABNORMAL["Layer 3b: 异常行为检测\nVideoMAE 重建误差\n(anomaly detection)"] COMMON --> AGG["Layer 4: 时序聚合\n滑动窗口 + 规则引擎"] ABNORMAL --> AGG AGG --> OUTPUT["结构化事件输出"]
分层策略的理由
- 常见行为(走/跑/跳/进食/舔毛)在 Animal Kingdom 和 MammalNet 中有数据,可以用 X3D-M 做 fine-tune,路线清晰
- 异常行为(呕吐/抽搐)无公开数据,走 anomaly detection 范式更实际——不要求精确分类,而是检测"不正常"的帧,再上报云端
- 姿态估计是可选层:如果骨架路线验证效果好,SuperAnimal + STGCN++ 可以作为轻量替代方案
分阶段实施路径
| 阶段 | 目标 | 模型 | 数据 |
|---|---|---|---|
| Phase 1(当前) | 建立 baseline | X3D-M zero-shot + fine-tune | Animal Kingdom 猫科子集 + 自标少量 |
| Phase 2 | 精度提升 | VideoMAE V2 预训练 → 蒸馏到 X3D-M | Animal Kingdom + MammalNet + 合成 |
| Phase 3 | 端侧部署 | INT8 量化 + RKNN 适配 | 真实监控场景视频 |
| Phase 4(探索) | 架构升级 | VideoMamba-Ti(待 SSM 部署成熟) | 混合数据 |
五个核心判断
- RGB 路线优先于骨架路线:猫科姿态估计虽有 SuperAnimal 兜底,但整体 pipeline 复杂度更高。X3D-M(2.6M / 2.7G FLOPs)是 RGB 方案的首选起点
- 常见行为技术路线已清晰:从 Animal Kingdom 猫科子集迁移 + X3D-M fine-tune,有数据有模型有 benchmark
- 异常行为是真正的难题:呕吐/抽搐在所有公开数据中完全空白,anomaly detection 范式 + 合成数据是两条可行路径
- 知识蒸馏是精度与效率的桥梁:VideoMAE V2 预训练权重 → X3D-M 学生模型,典型精度损失 2-4%
- SSM 部署还不成熟:VideoMamba 精度优秀但选择性扫描算子缺乏 NPU 支持,作为技术储备持续关注
- 输入模态在扩展:RGB-D(单目深度)和稀疏轨迹是两条值得关注的新路线——前者无需额外硬件即可增加深度信息,后者提供纯运动驱动的轻量表示,两者都对猫咪场景有适配潜力
下一步行动项
- 搭建 X3D-M baseline:在 mmaction2 中加载 X3D-M 预训练权重,用 Animal Kingdom 猫科子集做 fine-tune,建立常见行为的 zero-shot 和 fine-tune 两个 baseline
- 精读 PMTNet(2026):目前唯一专门做猫咪行为识别的论文,其部件级建模思路(body/head/tail 检测 → 时序建模)值得深入分析
- 验证 SuperAnimal:在真实猫咪视频上跑 SuperAnimal 零样本姿态估计,评估骨架质量和下游行为分类可行性
- 探索 RGB-D 融合:用 MiDaS-small 从猫咪视频生成 depth map,验证 DEAR 式双流融合是否带来精度提升
- 启动任务 2 和任务 3:数据集搜集已在本文覆盖,Benchmark 搭建可以基于本文的选型建议直接启动
框架与工具
新架构论文
- Li, K. et al. (2024). VideoMamba: State Space Model for Efficient Video Understanding. ECCV 2024. GitHub
- VideoMambaPro: Snakes and Ladders. ICCV 2025. arXiv
- Tong, Z. et al. (2023). VideoMAE V2: Scaling Video Masked Autoencoders with Dual Masking. CVPR 2023. GitHub
- InternVideo2: Scaling Foundation Models for Multimodal Video Understanding. ECCV 2024. GitHub
- SkateFormer: Skeletal-Temporal Transformer for Human Action Recognition. ECCV 2024. GitHub
动物行为数据集与方法
- Xu, C. et al. (2022). Animal Kingdom: A Large and Diverse Dataset for Animal Behavior Understanding. CVPR 2022 Oral. GitHub
- MammalNet: A Large-Scale Video Benchmark for Mammal Behavior Understanding. CVPR 2023. GitHub
- SuperAnimal: Pretrained deep learning models for animal pose tracking. Nature Communications, 2024. DeepLabCut
- PMTNet: Cat Behavior Recognition via Part-level Temporal Modeling. Animals (MDPI), 2026.
- Yu, T. et al. (2021). AP-10K: A Benchmark for Animal Pose Estimation. NeurIPS 2021. GitHub
边缘部署
- EdgeOAR: Real-time Online Action Recognition On Edge Devices. IEEE TMC, 2025.
- TinyAct: Edge-Cloud Collaborative Action Recognition via Knowledge Distillation. PLOS ONE, 2025.
其他输入模态
- Rahmani, S. et al. (2024). DEAR: Depth-Estimated Action Recognition. ECCV 2024 Workshop. Project
- MAGNet: Enhancing Action Recognition with Multimodal Fusion and Adaptive Graph Convolution. Nature Scientific Reports, 2026.
- TrAction: Action Recognition with Sparse Trajectories. arXiv:2606.03490, 2026. GitHub
- 3DInAction: Understanding Human Actions in 3D Point Clouds. arXiv:2303.06346, 2023.
- Cao, M. et al. (2026). Seeing Motion Through Polarity for Event-based Action Recognition. CVPR 2026.
- Wu, G. et al. (2024). 4D Gaussian Splatting for Real-Time Dynamic Scene Rendering. CVPR 2024. GitHub
- A Comprehensive Survey on RGB-D-based Human Action Recognition. Springer JIVP, 2025.